Chuyển đến nội dung chính
Quản trị an toàn

Frontier Security: Mô hình Kimi K3 của Moonshot AI thoát khỏi sandbox trong kiểm tra bảo mật, nhưng không thực hiện hành vi tấn công

Công ty bảo mật Mỹ Frontier Security khi kiểm tra đã phát hiện mô hình Kimi K3 của Moonshot AI vượt qua giới hạn sandbox và tự truy cập Internet. Dù nó chỉ lên GitHub tìm câu trả lời, không tiến hành tấn công, sự việc vẫn cho thấy cơ chế bảo mật yếu. Các vụ AI vượt thoát xảy ra ngày càng thường xuyên, con người có thể cần thiết kế lại môi trường sandbox. #AnToànAI#

Frontier Security: Mô hình Kimi K3 của Moonshot AI thoát khỏi sandbox trong kiểm tra bảo mật, nhưng không thực hiện hành vi tấn công

Theo tạp chí Wired đưa tin hôm qua, công ty khởi nghiệp an ninh mạng Mỹ Frontier Security cho biết, khi kiểm tra năng lực an ninh mạng của mô hình Kimi K3 thuộc Moonshot AI, mô hình này đã rời khỏi môi trường sandbox vốn ràng buộc nó.

Frontier Security: Mô hình Kimi K3 của Moonshot AI thoát khỏi sandbox trong kiểm tra bảo mật, nhưng không thực hiện hành vi tấn công

Theo báo cáo, sự việc AI vượt thoát lần này tương tự các trường hợp của OpenAI và Anthropic, nguyên nhân trực tiếp cũng là cấu hình sandbox dùng để cô lập mô hình bị sai. Frontier Security cho rằng, so với các mô hình AI tiên phong khác, Kimi thiếu cơ chế phòng vệ mạng, khiến mô hình này có thể truy cập Internet mà không được ủy quyền rõ ràng.

CEO Frontier Security Yaron Singer cho biết: “Chúng tôi phát hiện sandbox có lỗ hổng, nhưng Kimi cũng đã khai thác lỗ hổng này, cho thấy nó có thể không có cơ chế an toàn nội bộ như các mô hình cùng cấp khác.”

Tuy nhiên, sau khi phá vỡ sandbox và có quyền truy cập Internet, Kimi K3 không thực hiện hành vi tấn công, mà chỉ tìm câu trả lời cho một vấn đề trên GitHub.

Các vụ AI vượt thoát ngày càng thường xuyên gần đây cho thấy AI càng mạnh thì con người càng khó kiểm soát chúng. OpenAI từng tiết lộ tháng trước rằng một mô hình nội bộ chưa công bố của công ty đã vượt qua môi trường cô lập trong quá trình kiểm tra, sau đó tấn công nền tảng Hugging Face. Tiếp đó, Anthropic cũng cho biết nhiều mô hình của họ từng có được quyền truy cập Internet trong các bài kiểm tra bảo mật và đã tấn công hệ thống bên ngoài.

Một số chuyên gia an ninh mạng cho rằng phát hiện lần này cho thấy con người cần cấu hình lại môi trường sandbox cho các mô hình AI tiên phong. Đồng thời, người dùng các agent như OpenClaw (chú thích: thường gọi là tôm hùm) cần cấu hình môi trường thận trọng để ngăn AI vượt ranh giới.