주요 콘텐츠로 건너뛰기

Orchard – Microsoft Research가 오픈 소스로 공개한 Agentic AI 모델링 프레임워크 운영 중

Orchard는 Microsoft Research가 오픈 소스로 공개한 Agentic AI 모델링 프레임워크로, 개발자에게 통합 샌드박스 환경과 학습·평가 기능을 제공합니다.

Orchard – Microsoft Research가 오픈 소스로 공개한 Agentic AI 모델링 프레임워크입니다. 이 프레임워크는 Kubernetes 기반 Orchard Env 환경 서비스를 핵심으로 하며, 여러 도메인에서 샌드박스를 재사용해 데이터 증류, 강화학습 rollout 및 평가를 수행할 수 있도록 지원합니다. 소프트웨어 엔지니어링, 브라우저 탐색, 개인 비서의 세 가지 주요 시나리오를 아우르며, 완전한 SFT + RL 학습 레시피와 107K개의 SWE 트레이스 및 3,070개의 GUI 멀티모달 rollout 데이터를 제공합니다. 또한 Codex, OpenClaw와 같은 실제 harness에서 엔드투엔드 학습을 직접 수행할 수 있습니다. Agent 연구개발을 수행하는 학계 및 산업 연구팀을 대상으로 Orchard는 더 낮은 컴퓨팅 및 호스팅 비용을 제공하며, harness 간 일반화 능력을 통해 더 작은 모델로도 최첨단 성능에 근접하도록 지원합니다.

Orchard – Microsoft Research가 오픈 소스로 공개한 Agentic AI 모델링 프레임워크 제품 인터페이스
월간 방문 수
0
가격
무료 및 유료
등록일
2026-08-04
업데이트됨
2026-08-04

01Orchard란 무엇인가

Orchard는 Microsoft Research가 공개한 오픈 소스 Agentic AI 모델링 프레임워크로, Kubernetes 기반 Orchard Env 환경 서비스가 핵심입니다. 여러 도메인에서 샌드박스를 재사용해 데이터 증류, 강화학습 rollout 및 평가를 수행할 수 있습니다. 프레임워크는 소프트웨어 엔지니어링, 브라우저 탐색, 개인 비서의 세 가지 주요 시나리오를 지원하며, 학습 데이터와 평가 방법도 공개했습니다.

02Orchard의 주요 기능

도메인 간 통합 환경 서비스: Orchard Env는 샌드박스 수명 주기 관리, 명령 실행, 파일 I/O, 네트워크 정책 및 REST API를 제공하며, 하나의 인프라로 코드, 웹, 데스크톱, 모바일 및 생산성 워크플로를 지원합니다.
세 가지 분야의 학습 레시피: Orchard-SWE는 코드 수정에 특화되고, Orchard-GUI는 시각 기반 웹 탐색을 처리하며, Orchard-Claw는 이메일과 캘린더 등 일상적인 생산성 작업을 대상으로 합니다. 세 가지 모두 완전한 SFT + RL 학습 파이프라인을 제공합니다.
실제 Harness에서 학습: Codex, OpenClaw, ZeroClaw 등 실제 배포 harness에서 엔드투엔드 학습과 평가를 직접 수행할 수 있어 학습 환경과 배포 환경 간의 불일치를 해소합니다.
오픈 소스 데이터셋 및 평가 프로토콜: 107K개의 SWE 트레이스와 3,070개의 GUI 멀티모달 rollout 데이터, 그리고 이에 대응하는 평가 벤치마크와 재현 가능한 레시피를 공개합니다.

03Orchard의 기술 원리

WeChat에서 팔로우한 뒤 “开源”라고 답장하면 AI 오픈 소스 프로젝트 교류 그룹에 가입할 수 있습니다.
Kubernetes-native 환경 계층: Orchard Env는 독립 서비스로 실행되며, 컨테이너 오케스트레이션을 통해 수천 개의 격리된 샌드박스를 병렬로 생성하고 삭제합니다. 평균 명령 실행 지연 시간은 0.28초에 불과하며, 자동 확장·축소와 Redis 분산 잠금을 지원합니다.
Credit-Assignment SFT: 소프트웨어 엔지니어링 분야에서 시스템은 일부 실패한 트레이스를 버리지 않고, 유효한 구간에서 지도 신호를 추출해 활용 가능한 학습 데이터의 양을 극대화합니다.
Balanced Adaptive Rollout + 밀집 보상: RL의 희소 피드백 문제를 해결하기 위해 균형 잡힌 적응형 rollout으로 드문 성공 신호를 포착하고, on-policy 증류 및 규칙 기반 프로세스 보상 모델을 도입해 중간 단계에 밀집된 지침을 제공합니다.
Value Model 재순위화: 20회의 과거 실험에서 얻은 rollout 트레이스로 4B 파라미터 가치 모델을 학습하고, 추론 단계에서 여러 후보 해법을 평가해 최적의 해법을 선택합니다. 이를 통해 Orchard-SWE의 성능을 69.7%에서 73.0%로 향상시켰습니다.
Harness-Agnostic 에이전트 기록: 경량 에이전트 기록 harness가 harness 자체의 모델 호출을 기록하고 이를 학습 샘플로 재구성합니다. 따라서 환경 이미지를 수정하지 않고도 모든 RL 코드베이스를 어떤 harness와도 연동할 수 있습니다.

04Orchard 사용 방법

SDK 설치: pip install -e "orchard_env[dev]"를 실행해 Python SDK를 설치하고, SANDBOX_BASE_URL 및 SANDBOX_API_KEY 환경 변수를 설정합니다.
샌드박스 빠른 호출: SandboxClient 컨텍스트 관리자를 사용해 샌드박스를 생성하고 명령을 실행합니다. 동기·비동기 모드, 파일 읽기·쓰기, git patch 적용 및 PTY 세션을 지원합니다.
오케스트레이터 배포: Azure AKS에서 제공하는 네 가지 스크립트(provision, build, deploy, smoke-test)를 통해 약 20분 만에 다중 복제본 오케스트레이터를 배포할 수 있으며, Azure가 아닌 클러스터도 지원합니다.
학습 레시피 실행: GitHub 저장소의 trainer/slime/ 디렉터리를 참고해 Orchard Env에서 Orchard-SWE, Orchard-GUI 또는 Orchard-Claw의 전체 SFT + RL 학습 과정을 실행합니다.

05Orchard의 핵심 장점

소형 모델로 대형 모델 성능에 근접: Orchard-SWE는 약 3B개의 활성 파라미터만으로 SWE-bench Verified에서 73.0%를 달성해 파라미터 수가 10배 이상인 최첨단 시스템에 근접합니다. Orchard-GUI는 4B 파라미터로 세 가지 주요 웹 벤치마크에서 평균 68.4%를 달성해 OpenAI CUA 및 Gemini CUA에 필적합니다.
비용 대폭 절감: E2B, Daytona 등 관리형 샌드박스 서비스와 비교할 때 Orchard Env의 종량제 비용은 약 0.47배이며, Spot 인스턴스 비용은 0.10배에 불과해 약 10배의 가격 차이가 있습니다.
뛰어난 Harness 간 일반화 능력: 동일한 환경 계층에서 ReACT, ZeroClaw, OpenClaw, Codex 등 다양한 harness를 지원하며, Orchard-Claw는 ZeroClaw에서 pass@3가 59.6%에서 73.9%로 향상되었습니다.
효율적인 학습 데이터: Orchard-GUI는 증류 데모 400개와 공개 작업 2,200개만으로 오픈 소스 웹 Agent 중 최고 수준에 도달했습니다. 이는 적은 데이터와 올바른 환경을 결합하면 높은 역량의 모델을 학습할 수 있음을 보여줍니다.

06Orchard 프로젝트 주소

프로젝트 공식 웹사이트: https://www.microsoft.com/en-us/research/blog/orchard-an-open-framework-for-scalable-agentic-ai/
GitHub 저장소: https://github.com/microsoft/Orchard
HuggingFace 모델 저장소: https://huggingface.co/datasets/microsoft/Orchard
arXiv 기술 논문: https://arxiv.org/pdf/2605.15040

07Orchard의 활용 시나리오

자동화된 소프트웨어 엔지니어링: 실제 코드베이스에서 Bug를 자율적으로 진단하고, 테스트를 작성하며, 패치를 생성하고 검증을 통과시킵니다. 오픈 소스 프로젝트 유지 관리와 기업 내부 코드 검토에 적합합니다.
지능형 웹 탐색: 시각적 이해를 바탕으로 브라우저를 자동 조작해 예약, 쇼핑, 정보 검색 등 개방형 도메인 작업을 수행하며, RPA의 대안으로 활용할 수 있습니다.
개인 생산성 도우미: 이메일, 캘린더, 문서 등 여러 도구에 걸쳐 복잡한 워크플로를 실행합니다. 예를 들어 회의 자동 예약, 받은편지함 정리, 보고서 생성을 수행할 수 있습니다.
Agent 연구 인프라: 학계 및 산업 연구팀에 재현 가능하고 비용 효율적인 Agent 학습·평가 플랫폼을 제공해 오픈 소스 Agentic AI 생태계 구축을 가속합니다.
도메인 간 Agent 역량 전이: 통합 환경 계층을 활용해 코드, 웹, 데스크톱 조작 간의 기술 전이와 누적 학습을 탐구합니다.

© 면책 조항: 도메인 및 연결된 콘텐츠는 시간이 지나면서 변경될 수 있습니다. AIEZZ은(는) 제3자 웹사이트를 관리하지 않습니다. 외부 콘텐츠와 위험을 독립적으로 검토하세요.

사용자 리뷰0