- Lượt truy cập hàng tháng
- 0
- Giá
- Miễn phí và Trả phí
- Được liệt kê
- 2026-08-04
- Đã cập nhật
- 2026-08-04
01Orchard là gì
Orchard là khung mô hình hóa Agentic AI mã nguồn mở do Microsoft Research phát triển, với dịch vụ môi trường Orchard Env dựa trên Kubernetes làm cốt lõi, hỗ trợ tái sử dụng sandbox trên nhiều lĩnh vực để chưng cất dữ liệu, rollout học tăng cường và đánh giá. Khung đã bao phủ ba nhóm kịch bản: kỹ thuật phần mềm, điều hướng trình duyệt và trợ lý cá nhân, đồng thời công bố dữ liệu huấn luyện và phương pháp đánh giá.
02Các tính năng chính của Orchard
Dịch vụ môi trường thống nhất đa lĩnh vực: Orchard Env cung cấp quản lý vòng đời sandbox, thực thi lệnh, I/O tệp, chính sách mạng và REST API. Một hạ tầng duy nhất có thể hỗ trợ mã nguồn, web, máy tính để bàn, thiết bị di động và các quy trình năng suất.
Công thức huấn luyện cho ba lĩnh vực: Orchard-SWE tập trung vào sửa mã, Orchard-GUI xử lý điều hướng web bằng thị giác, còn Orchard-Claw hướng đến các tác vụ năng suất hằng ngày như email và lịch. Tất cả đều cung cấp quy trình huấn luyện SFT + RL hoàn chỉnh.
Huấn luyện trong Harness thực tế: Hỗ trợ huấn luyện và đánh giá đầu cuối trực tiếp trong các harness triển khai thực tế như Codex, OpenClaw và ZeroClaw, loại bỏ sự không tương thích giữa môi trường huấn luyện và môi trường triển khai.
Bộ dữ liệu và giao thức đánh giá mã nguồn mở: Công bố 107K quỹ đạo SWE và 3,070 dữ liệu rollout đa phương thức GUI, cùng các chuẩn đánh giá và công thức có thể tái lập tương ứng.
03Nguyên lý kỹ thuật của Orchard
Theo dõi WeChat và trả lời “开源” để tham gia nhóm trao đổi dự án AI mã nguồn mở
Lớp môi trường Kubernetes-native: Orchard Env chạy như một dịch vụ độc lập, sử dụng điều phối container để tạo và hủy song song hàng nghìn sandbox biệt lập. Độ trễ thực thi lệnh trung bình chỉ 0.28 giây, đồng thời hỗ trợ tự động mở rộng và khóa phân tán Redis.
Credit-Assignment SFT: Trong lĩnh vực kỹ thuật phần mềm, hệ thống không loại bỏ các quỹ đạo thất bại một phần mà trích xuất tín hiệu giám sát từ những đoạn có giá trị, qua đó tối đa hóa lượng dữ liệu huấn luyện có thể sử dụng.
Balanced Adaptive Rollout + phần thưởng dày đặc: Để giải quyết phản hồi thưa trong RL, hệ thống sử dụng rollout thích ứng cân bằng nhằm thu thập các tín hiệu thành công hiếm gặp, đồng thời đưa vào chưng cất on-policy và mô hình phần thưởng quy trình dựa trên luật để cung cấp hướng dẫn dày đặc cho các bước trung gian.
Sắp xếp lại bằng Value Model: Sử dụng các quỹ đạo rollout từ 20 thí nghiệm trước đây để huấn luyện mô hình giá trị có 4B tham số. Ở giai đoạn suy luận, mô hình chấm điểm nhiều lời giải ứng viên và chọn phương án tối ưu, nâng Orchard-SWE từ 69.7% lên 73.0%.
Ghi nhận tác tử không phụ thuộc Harness: Harness ghi nhận nhẹ bản thân các lần gọi mô hình rồi tái cấu trúc chúng thành mẫu huấn luyện, cho phép mọi thư viện mã RL kết nối với mọi harness mà không cần sửa image môi trường.
04Cách sử dụng Orchard
Cài đặt SDK: Chạy pip install -e "orchard_env[dev]" để cài đặt Python SDK, sau đó cấu hình các biến môi trường SANDBOX_BASE_URL và SANDBOX_API_KEY.
Gọi sandbox nhanh: Sử dụng trình quản lý ngữ cảnh SandboxClient để tạo sandbox và thực thi lệnh, hỗ trợ chế độ đồng bộ và bất đồng bộ, đọc ghi tệp, áp dụng git patch và phiên PTY.
Triển khai bộ điều phối: Sử dụng bốn script do Azure AKS cung cấp (provision, build, deploy, smoke-test), có thể hoàn tất triển khai bộ điều phối nhiều bản sao trong khoảng 20 phút; đồng thời cũng hỗ trợ các cụm không chạy trên Azure.
Chạy công thức huấn luyện: Tham khảo thư mục trainer/slime/ trong kho GitHub để thực hiện quy trình huấn luyện SFT + RL hoàn chỉnh cho Orchard-SWE, Orchard-GUI hoặc Orchard-Claw trên Orchard Env.
05Ưu điểm cốt lõi của Orchard
Mô hình nhỏ tiệm cận hiệu năng mô hình lớn: Orchard-SWE đạt 73.0% trên SWE-bench Verified với khoảng 3B tham số hoạt động, tiệm cận các hệ thống tiên tiến có số tham số lớn hơn ít nhất 10 lần; Orchard-GUI đạt trung bình 68.4% trên ba chuẩn web lớn với 4B tham số, tương đương OpenAI CUA và Gemini CUA.
Giảm đáng kể chi phí: So với các dịch vụ sandbox được lưu trữ như E2B và Daytona, chi phí theo nhu cầu của Orchard Env khoảng 0.47 lần, còn chi phí instance Spot chỉ 0.10 lần, chênh lệch giá khoảng 10 lần.
Khả năng khái quát xuyên Harness mạnh: Cùng một lớp môi trường hỗ trợ nhiều harness như ReACT, ZeroClaw, OpenClaw và Codex. Với ZeroClaw, Orchard-Claw nâng pass@3 từ 59.6% lên 73.9%.
Dữ liệu huấn luyện hiệu quả: Orchard-GUI chỉ sử dụng 400 bản trình diễn chưng cất và 2,200 tác vụ mở nhưng đã đạt mức hiệu năng của Agent web mã nguồn mở mạnh nhất, chứng minh rằng dữ liệu nhỏ kết hợp với môi trường phù hợp vẫn có thể huấn luyện mô hình năng lực cao.
06Địa chỉ dự án Orchard
Trang web dự án:https://www.microsoft.com/en-us/research/blog/orchard-an-open-framework-for-scalable-agentic-ai/
Kho GitHub:https://github.com/microsoft/Orchard
Kho mô hình HuggingFace:https://huggingface.co/datasets/microsoft/Orchard
Bài báo kỹ thuật arXiv:https://arxiv.org/pdf/2605.15040
07Các kịch bản ứng dụng của Orchard
Tự động hóa kỹ thuật phần mềm: Tự chủ chẩn đoán lỗi, viết kiểm thử, tạo bản vá và xác minh trong các kho mã thực tế, phù hợp với việc bảo trì dự án mã nguồn mở và rà soát mã nội bộ doanh nghiệp.
Điều hướng web thông minh: Dựa trên khả năng hiểu hình ảnh để tự động thao tác trình duyệt, hoàn thành các tác vụ miền mở như đặt vé, mua sắm và truy xuất thông tin; có thể là giải pháp thay thế RPA.
Trợ lý năng suất cá nhân: Thực hiện quy trình phức tạp trên email, lịch, tài liệu và các công cụ khác, chẳng hạn như tự động sắp xếp cuộc họp, dọn dẹp hộp thư đến và tạo báo cáo.
Hạ tầng nghiên cứu Agent: Cung cấp cho các nhóm nghiên cứu học thuật và công nghiệp nền tảng huấn luyện và đánh giá Agent có thể tái lập với chi phí thấp, thúc đẩy hệ sinh thái Agentic AI mã nguồn mở.
Chuyển giao năng lực Agent giữa các lĩnh vực: Sử dụng lớp môi trường thống nhất để nghiên cứu chuyển giao kỹ năng và học tích lũy giữa thao tác mã nguồn, web và máy tính để bàn.
© Tuyên bố miễn trừ trách nhiệm: tên miền và nội dung được liên kết có thể thay đổi theo thời gian. AIEZZ không kiểm soát các trang web của bên thứ ba. Hãy tự đánh giá nội dung bên ngoài và các rủi ro liên quan.


Đánh giá của người dùng0