Chuyển đến nội dung chính
Iris

Iris Đang hoạt động

Iris là tác nhân tìm kiếm do đội ngũ AllSpark của Xiaohongshu mã nguồn mở, gồm hai phiên bản 35B (Iris-mini) và 397B (Iris-pro). Iris có thể tự quyết định nên tìm gì, đọc như thế nào và khi nào hội tụ để trả lời trong mạng Internet thực tế...

Iris là tác nhân tìm kiếm do đội ngũ AllSpark của Xiaohongshu mã nguồn mở, gồm hai phiên bản 35B (Iris-mini) và 397B (Iris-pro). Iris có thể tự quyết định nên tìm gì, đọc như thế nào và khi nào hội tụ để trả lời trong mạng Internet thực tế...

Iris
Lượt truy cập hàng tháng
0
Giá
Chưa đặt
Được liệt kê
—
Đã cập nhật
2026-09-16

01Iris là gì

Iris là tác nhân tìm kiếm do đội ngũ AllSpark của Xiaohongshu mã nguồn mở, gồm hai phiên bản 35B (Iris-mini) và 397B (Iris-pro). Iris có thể tự quyết định nên tìm gì, đọc như thế nào và khi nào hội tụ để trả lời trong mạng Internet thực tế. Iris xây dựng ngược dữ liệu huấn luyện đủ khó và có thể giải được từ các siêu liên kết trên web, đồng thời áp dụng phương pháp huấn luyện SFT–RL Climbing xen kẽ giữa SFT và học tăng cường. Trên bốn chuẩn đánh giá lớn gồm BrowseComp, DeepSearchQA và HLE, Iris đạt thành tích mã nguồn mở mạnh nhất trong cùng phân khúc; phiên bản 35B đã tiệm cận các mô hình có hàng nghìn tỷ tham số, và năng lực tìm kiếm có thể mở rộng sang các nhiệm vụ như gọi công cụ tổng quát.

02Các chức năng chính của Iris

Tìm kiếm web tự chủ: tự quyết định nên tìm gì, đọc kết quả truy xuất như thế nào và khi nào tiếp tục hoặc dừng, vừa tìm kiếm vừa suy luận và trả lời.
Suy luận đa bước qua nhiều trang: có thể lần lượt xác định câu trả lời duy nhất từ nhiều trang web, thay vì đi đường tắt bằng cách khớp từ khóa.
Truy xuất phức tạp bằng tiếng Trung và tiếng Anh: đạt thành tích mã nguồn mở mạnh nhất trong cùng phân khúc trên các nhiệm vụ truy xuất trang web bằng tiếng Trung và tiếng Anh như BrowseComp và BrowseComp-ZH.
Hỏi đáp bao quát bằng chứng: bao quát đầy đủ chuỗi bằng chứng khi trả lời, đạt kết quả dẫn đầu trên DeepSearchQA.
Giải bài toán cấp chuyên gia: có thể xử lý các vấn đề khó như HLE, đòi hỏi năng lực suy luận cấp chuyên gia.
Quản lý ngữ cảnh: hỗ trợ các chiến lược quản lý ngữ cảnh như cắt ngắn và nén, giúp tìm kiếm chuỗi dài không bị gián đoạn, đặc biệt có lợi cho các mô hình nhỏ.
Mở rộng năng lực: có thể thực hiện các nhiệm vụ như gọi công cụ tổng quát và cộng tác văn phòng mà không cần huấn luyện chuyên biệt.

03Nguyên lý kỹ thuật của Iris

Theo dõi WeChat và trả lời “开源” để tham gia nhóm trao đổi dự án mã nguồn mở AI
Xây dựng dữ liệu bằng phương pháp tạo câu hỏi ngược: lấy trang hạt giống làm đáp án, lần theo các siêu liên kết để hình thành đồ thị thực thể, tạo trên đồ thị các câu hỏi buộc phải suy luận nhiều bước qua nhiều trang, sau đó viết lại các thực thể ngoài đáp án trong đề bài thành các cách diễn đạt mô tả để xóa bỏ manh mối có thể khớp. Cuối cùng, dùng mô hình tham chiếu để sàng lọc hai lần; chỉ giữ lại các câu hỏi mà mô hình không thể trả lời khi đóng tài liệu nhưng có thể trả lời duy nhất khi được cung cấp bằng chứng. Toàn bộ quy trình được tự động hóa và có thể mở rộng theo quy mô dữ liệu.
Huấn luyện xen kẽ SFT–RL Climbing: trong giai đoạn SFT, mô hình giáo viên mạnh tạo quỹ đạo trên công cụ tìm kiếm thực tế, sau đó huấn luyện qua bước lọc kết quả và lọc từng bước bằng “giám khảo”; trong giai đoạn RL, mô hình vừa tìm kiếm vừa học trên Internet thực tế. Sau mỗi vòng, các quỹ đạo khó nhất nhưng được giải đúng và các quỹ đạo hiệu quả nhất được đưa trở lại vòng SFT tiếp theo. Khi mô hình mạnh hơn, câu hỏi cũng tự động trở nên khó hơn, hình thành chương trình học thích ứng.
Nội hóa hạ tầng huấn luyện: việc chấm điểm và tóm tắt được thực hiện bằng các mô hình tự xây dựng bên trong cụm huấn luyện, không phụ thuộc vào bất kỳ API bên ngoài nào, tránh để biến động mạng ảnh hưởng đến vòng lặp huấn luyện; đồng thời sử dụng cùng một bộ tóm tắt trong huấn luyện và vận hành trực tuyến, loại bỏ sự lệch pha giữa huấn luyện và suy luận.
Tiếp tục chạy từ điểm ngắt đối với quỹ đạo siêu dài: các phiên hội thoại siêu dài gây cản trở không còn bị loại bỏ toàn bộ. Quy trình sẽ ngắt ở cấp yêu cầu và tiếp tục từ tiền tố đã gửi ở bước kế tiếp, giúp GPU duy trì mức sử dụng cao trong điều phối đồng bộ.
Giao thức đánh giá căn chỉnh: mọi hệ thống so sánh đều được đánh giá trong cùng điều kiện về công cụ, ngữ cảnh, mô hình chấm điểm và chiến lược quản lý ngữ cảnh, chỉ sử dụng một tác nhân ReAct. Điều này loại bỏ các cách tận dụng khung như đa tác nhân và tự xác minh khi kiểm thử, để điểm số phản ánh chân thực năng lực của bản thân mô hình.

04Cách sử dụng Iris

Sao chép kho mã: thực thi git clone https://github.com/AllSpark-Research/Iris để lấy mã suy luận và đánh giá.
Tải trọng số mô hình: tải trọng số Iris-mini (35B) hoặc Iris-pro (397B) từ bộ sưu tập HuggingFace huggingface.co/collections/AllSpark-Research/iris.
Cấu hình môi trường chạy: cài đặt các phần phụ thuộc theo yêu cầu của kho mã, chẳng hạn các framework suy luận vLLM/SGLang, đồng thời cấu hình giao diện công cụ tìm kiếm. Tìm kiếm trực tuyến là điều kiện cần thiết đối với Search Agent.
Nạp mô hình và kết nối công cụ: nạp mô hình dưới dạng tác nhân ReAct, đăng ký công cụ tìm kiếm để mô hình gọi.
Đặt câu hỏi và chạy suy luận: nhập câu hỏi, mô hình sẽ tự động lập kế hoạch truy vấn tìm kiếm, đọc trang web, suy luận nhiều bước và hội tụ để đưa ra câu trả lời kèm bằng chứng.

05Ưu thế cốt lõi của Iris

Thành tích mã nguồn mở mạnh nhất trong cùng phân khúc: dẫn đầu toàn diện các mô hình mã nguồn mở cùng phân khúc trên bốn chuẩn tìm kiếm BrowseComp, BrowseComp-ZH, DeepSearchQA và HLE; Iris-pro 397B còn vượt các mô hình cấp hàng nghìn tỷ tham số ở một số hạng mục.
Mô hình nhỏ tiệm cận mô hình cực lớn: Iris-mini 35B đạt 82.2 điểm trên BrowseComp, đã tiệm cận các mô hình có số tham số lớn hơn hàng chục lần như Kimi-K2.6, giúp mô hình nhỏ có khả năng thách thức mô hình cực lớn trong các lĩnh vực chuyên biệt.
Xây dựng dữ liệu tự động và chất lượng cao: tạo câu hỏi ngược từ siêu liên kết trên web, xóa manh mối có thể khớp và sàng lọc hai lần để bảo đảm “đủ khó và có thể giải”; toàn bộ quy trình không cần con người tạo câu hỏi và có thể mở rộng không giới hạn theo quy mô dữ liệu.
Hạ tầng huấn luyện ổn định và hiệu quả: việc chấm điểm và tóm tắt được nội hóa trong cụm huấn luyện, hoàn toàn thoát khỏi sự phụ thuộc vào API bên ngoài; tiếp tục chạy quỹ đạo siêu dài từ điểm ngắt giúp GPU luôn hoạt động ở công suất cao, giảm đáng kể tính bất định của quá trình huấn luyện.
Nhất quán giữa huấn luyện và vận hành: bộ tóm tắt dùng để nén nội dung truy xuất trong huấn luyện, đánh giá và vận hành trực tuyến là cùng một bộ, không tồn tại sự lệch pha giữa huấn luyện và sử dụng.
Mở rộng năng lực, tính tổng quát cao: năng lực tìm kiếm được khái quát hóa sang các nhiệm vụ chưa từng được huấn luyện chuyên biệt như gọi công cụ tổng quát và cộng tác văn phòng; Search là một năng lực nguyên tử có thể tái sử dụng.

06Địa chỉ dự án Iris

Kho GitHub: https://github.com/AllSpark-Research/Iris
Kho mô hình HuggingFace: https://huggingface.co/collections/AllSpark-Research/iris
Bài báo kỹ thuật arXiv: https://arxiv.org/pdf/2609.04304

07Các kịch bản ứng dụng của Iris

Nghiên cứu chuyên sâu/báo cáo nghiên cứu: tự động truy xuất nhiều vòng, suy luận qua nhiều trang và bao quát đầy đủ bằng chứng, phù hợp với các sản phẩm Deep Research như nghiên cứu ngành, phân tích đối thủ và nghiên cứu học thuật.
Xác minh sự kiện phức tạp: phù hợp với các tình huống như bác bỏ tin giả, kiểm chứng sự kiện và thẩm định, trong đó câu trả lời phải được xác định qua nhiều bước trên nhiều trang web và “bắt buộc phải tìm được nguồn”.
Tìm kiếm song ngữ Trung-Anh: đạt kết quả tốt ở cả BrowseComp và BrowseComp-ZH, tự nhiên phù hợp với việc truy xuất thông tin xuyên biên giới từ ngữ liệu kết hợp tiếng Trung và tiếng Anh.
Tác nhân gọi công cụ tổng quát: năng lực mở rộng sang các nhiệm vụ General Tool Use như BFCL và τ-bench, có thể làm nền tảng tổng quát cho các sản phẩm Agent.
Cộng tác văn phòng (Cowork): có thể bắt đầu sử dụng trên các nhiệm vụ văn phòng như OfficeQA và APEX mà không cần huấn luyện chuyên biệt, phù hợp để tích hợp vào trợ lý văn phòng xử lý hỏi đáp tài liệu và các tác vụ quy trình.

© Tuyên bố miễn trừ trách nhiệm: tên miền và nội dung được liên kết có thể thay đổi theo thời gian. AIEZZ không kiểm soát các trang web của bên thứ ba. Hãy tự đánh giá nội dung bên ngoài và các rủi ro liên quan.

Đánh giá của người dùng0