Chuyển đến nội dung chính

ForgeStencil – Hệ thống nghiên cứu và triển khai tự động toàn diện Stencil do 面壁智能 phát triển Đang hoạt động

面壁智能 ra mắt ForgeStencil, tối ưu tự động toàn diện hoạt động nghiên cứu và triển khai sản xuất cho các ứng dụng Stencil dựa trên vòng lặp khép kín hai tác nhân.

ForgeStencil – Hệ thống nghiên cứu và triển khai tự động toàn diện Stencil do 面壁智能 phát triển, được xây dựng phối hợp với cộng đồng OpenBMB, áp dụng kiến trúc vòng lặp khép kín gồm Kernel Agent và App Agent. Hệ thống có thể tự động hoàn tất toàn bộ quy trình từ phát hiện chiến lược tối ưu, tổng hợp CUDA Kernel hiệu năng cao đến tích hợp và xác minh ứng dụng cấp sản xuất mà không cần can thiệp thủ công. Trong một tuần, hệ thống đã tối ưu đầu cuối hơn 100 phần mềm tính toán công nghiệp và khoa học, đạt mức tăng tốc trung vị 1.41 lần. Phạm vi ứng dụng bao phủ 8 lĩnh vực công nghiệp và 5 lĩnh vực khoa học lớn, gồm thăm dò dầu khí, mô phỏng điện từ và hình ảnh y khoa, qua đó giảm đáng kể sự phụ thuộc vào chuyên gia HPC và thời gian nghiên cứu phát triển.

ForgeStencil – Hệ thống nghiên cứu và triển khai tự động toàn diện Stencil do 面壁智能 phát triển Giao diện sản phẩm
Lượt truy cập hàng tháng
0
Giá
Miễn phí và Trả phí
Được liệt kê
2026-08-04
Đã cập nhật
2026-08-04

01ForgeStencil là gì

ForgeStencil là hệ thống tối ưu AI đầu tiên trên thế giới hỗ trợ tự động nghiên cứu và triển khai Stencil, do 面壁智能 phối hợp với cộng đồng mã nguồn mở OpenBMB phát triển. Dựa trên vòng lặp khép kín hai tác nhân Kernel Agent và App Agent, hệ thống thực hiện toàn bộ quy trình từ phát hiện chiến lược tối ưu đến tích hợp phần mềm sản xuất thực tế mà không cần can thiệp thủ công. Trong một tuần, hệ thống đã hoàn tất tối ưu đầu cuối hơn 100 phần mềm tính toán công nghiệp và khoa học, đạt mức tăng tốc trung vị 1.41 lần, bao phủ 8 lĩnh vực công nghiệp và 5 lĩnh vực khoa học lớn, gồm thăm dò dầu khí, mô phỏng điện từ và hình ảnh y khoa.

02Các chức năng chính của ForgeStencil

Tối ưu vòng lặp khép kín hai Agent: Kernel Agent tự nghiên cứu và tổng hợp CUDA Kernel hiệu năng cao; App Agent thực hiện định vị điểm nóng, rèn toán tử, xác minh tính đúng đắn và tích hợp ứng dụng.
Tự động phát hiện chiến lược: Agent tự khám phá các chiến lược tối ưu như phân khối, hợp nhất, bố cục, tỷ lệ chiếm dụng và tái cấu trúc phía máy chủ, thay vì tìm kiếm trong một không gian cố định.
Triển khai ứng dụng thực tế: Tối ưu trực tiếp phần mềm cấp sản xuất, lấy mã GPU của chính ứng dụng làm đường cơ sở để xác minh đầu cuối, không sử dụng Benchmark đơn giản hóa.
Giao thức đo lường có thể kiểm toán: Thông qua một công tắc môi trường duy nhất để chuyển đổi xen kẽ giữa đường dẫn gốc và đường dẫn tối ưu, sử dụng các bộ kiểm tra và bộ tính giờ có sẵn trong chương trình nhằm bảo đảm mức tăng tốc là chân thực và đáng tin cậy.
Tương thích GPU qua nhiều thế hệ: Hỗ trợ phân phối kiến trúc thời gian chạy A100/H100/B200; cùng một kho mã sẽ tự động chọn đường dẫn Kernel tối ưu theo kiến trúc.

03Nguyên lý kỹ thuật của ForgeStencil

Theo dõi WeChat và trả lời “开源” để tham gia nhóm trao đổi dự án AI mã nguồn mở
Kiến trúc phối hợp hai Agent: Hệ thống gồm Kernel Agent và App Agent, tạo thành một vòng lặp khép kín. Kernel Agent phụ trách khám phá lý thuyết, tự nghiên cứu và tổng hợp các toán tử Stencil tiệm cận giới hạn vật lý của phần cứng thông qua vòng lặp Plan→Code→Profile; App Agent phụ trách triển khai kỹ thuật, định vị điểm nóng hiệu năng của ứng dụng, thiết lập đường cơ sở GPU, gọi cơ sở tri thức ma trận toán tử do Kernel Agent xây dựng để rèn giải pháp tối ưu dành riêng cho ứng dụng, sau đó hoàn tất xác minh tính đúng đắn và tích hợp vào ứng dụng gốc.
Tiến hóa ma trận toán tử và cơ sở tri thức: Trong quá trình tối ưu, Kernel Agent liên tục xây dựng ma trận toán tử chuyên dụng làm cơ sở tri thức để App Agent có thể tái sử dụng các kỹ thuật hiện có; nhiều Agent song song cùng chia sẻ cơ sở tri thức này, cho phép chia sẻ kinh nghiệm theo thời gian thực và tiến hóa đồng bộ tập thể, vượt qua điểm nghẽn trong việc truyền đạt kinh nghiệm chuyên gia theo quy mô lớn.
Giao thức đầu cuối có thể kiểm toán: Việc đo lường lấy triển khai GPU cấp sản xuất của chính ứng dụng làm đường cơ sở duy nhất. Đường dẫn gốc và đường dẫn tối ưu chỉ được phân biệt bằng một công tắc USE_OURS duy nhất, đồng thời đường dẫn gốc nhất quán từng byte với mã upstream; hệ thống sử dụng bộ kiểm tra tính đúng đắn và bộ tính giờ tích hợp trong chương trình, lấy trung vị sau nhiều vòng chạy xen kẽ, rồi báo cáo mức tăng tốc trung bình hình học của tất cả trường hợp kiểm thử tiêu chuẩn, loại bỏ khả năng gian lận ở cấp hệ thống.
Chế độ Patch và không ràng buộc mã nguồn: Không đóng gói mã nguồn của bất kỳ bên thứ ba nào. Mỗi ứng dụng chỉ cung cấp thông tin nguồn upstream, tập lệnh lấy mã và bản vá tích hợp. vendor.sh tự động lấy mã nguồn upstream của phiên bản được chỉ định, bảo đảm giấy phép rõ ràng và kết quả có thể tái lập.

04Cách sử dụng ForgeStencil

Chuẩn bị môi trường: Sao chép kho mã và bảo đảm có GPU NVIDIA (đã xác minh trên A100), CUDA 12.x, trình biên dịch C++17 và môi trường Python 3.9+.
Trải nghiệm nhanh với toán tử: Chạy python tools/run.py --stencil star_1 --shape 256 --gpu 0 để đo hiệu năng của một toán tử trong vòng 1 phút và so sánh với đường cơ sở Halide.
Tái lập đầu cuối: Vào thư mục ứng dụng mục tiêu, chạy ./vendor.sh để lấy mã nguồn upstream, áp dụng bản vá tích hợp, sau đó chạy python ../../harness/run_e2e.py --app --gpu auto để hoàn tất xác minh ứng dụng thực tế.
Điều khiển Agent: Tham khảo agents/README.md để cấu hình và khởi động vòng lặp tối ưu tự động của Kernel Agent và App Agent.
Tra cứu sổ đăng ký kết quả: Xem dữ liệu tăng tốc đã kiểm toán của 100 ứng dụng được xác minh tại results/integration_registry.json.

05Ưu thế cốt lõi của ForgeStencil

Không cần can thiệp thủ công: Tự động hóa toàn bộ quy trình từ phân tích ứng dụng, định vị điểm nóng, rèn Kernel đến xác minh tích hợp, không cần chuyên gia HPC tham gia quyết định.
Định hướng theo tình huống thực tế: Tối ưu trực tiếp phần mềm công nghiệp cấp sản xuất; 42% là phần mềm sản xuất công nghiệp thực tế, với đường cơ sở là mã GPU của chính ứng dụng.
Đột phá hiệu suất nghiên cứu phát triển: Thời gian tối ưu một ứng dụng được rút ngắn từ vài tháng xuống còn trong một ngày; hoàn tất 100+ ứng dụng trong một tuần, tương đương tiết kiệm khoảng 20–30 người-năm công sức nghiên cứu phát triển.
Hiệu năng mạnh mẽ: Mức tăng tốc trung vị đầu cuối đạt 1.41 lần; 43% ứng dụng đạt ≥1.5 lần; trung bình hình học cấp toán tử đạt 2.16 lần, vượt đường cơ sở mã nguồn mở tốt nhất.
Duy trì qua nhiều kiến trúc: Hỗ trợ phân phối thời gian chạy trên nhiều thế hệ GPU NVIDIA; khi kiến trúc nâng cấp, hệ thống có thể tự động rèn lại Kernel để khai thác các đặc tính phần cứng mới.

06Địa chỉ dự án ForgeStencil

Kho GitHub:https://github.com/OpenBMB/ForgeStencil

07Tình huống ứng dụng của ForgeStencil

Thăm dò địa chấn dầu khí: Tối ưu các thuật toán cốt lõi như dịch chuyển ngược theo thời gian RTM và mini-app của Total, tăng tốc quy trình xử lý dữ liệu thăm dò dầu mỏ.
Thiết kế mô phỏng điện từ: Nâng cao hiệu quả giải các phương trình Maxwell trên lưới Yee như gprMax/FDTD, phục vụ phân tích điện từ radar và chip.
Tái tạo hình ảnh y khoa: Tăng tốc các tác vụ tính toán hình ảnh y khoa như tái tạo MRI phi Descartes và phép chiếu ngược trong chụp cắt lớp tuyến vú kỹ thuật số.
Khí hậu và vật lý thiên văn: Tối ưu các ứng dụng tính toán khoa học sử dụng nhiều Stencil, như động lực học khí quyển và mô phỏng vũ trụ học.
Tính toán tài chính định lượng: Tự động tối ưu các điểm nóng Stencil trong thư viện định giá của các tổ chức tài chính như QuantLib, giảm độ trễ tính toán giao dịch.

© Tuyên bố miễn trừ trách nhiệm: tên miền và nội dung được liên kết có thể thay đổi theo thời gian. AIEZZ không kiểm soát các trang web của bên thứ ba. Hãy tự đánh giá nội dung bên ngoài và các rủi ro liên quan.

Đánh giá của người dùng0