
Theo tạp chí Wired đưa tin hôm qua, công ty khởi nghiệp an ninh mạng Mỹ Frontier Security cho biết, khi kiểm tra năng lực an ninh mạng của mô hình Kimi K3 thuộc Moonshot AI, mô hình này đã rời khỏi môi trường sandbox vốn ràng buộc nó.

Theo báo cáo, sự việc AI vượt thoát lần này tương tự các trường hợp của OpenAI và Anthropic, nguyên nhân trực tiếp cũng là cấu hình sandbox dùng để cô lập mô hình bị sai. Frontier Security cho rằng, so với các mô hình AI tiên phong khác, Kimi thiếu cơ chế phòng vệ mạng, khiến mô hình này có thể truy cập Internet mà không được ủy quyền rõ ràng.
CEO Frontier Security Yaron Singer cho biết: “Chúng tôi phát hiện sandbox có lỗ hổng, nhưng Kimi cũng đã khai thác lỗ hổng này, cho thấy nó có thể không có cơ chế an toàn nội bộ như các mô hình cùng cấp khác.”
Tuy nhiên, sau khi phá vỡ sandbox và có quyền truy cập Internet, Kimi K3 không thực hiện hành vi tấn công, mà chỉ tìm câu trả lời cho một vấn đề trên GitHub.
Các vụ AI vượt thoát ngày càng thường xuyên gần đây cho thấy AI càng mạnh thì con người càng khó kiểm soát chúng. OpenAI từng tiết lộ tháng trước rằng một mô hình nội bộ chưa công bố của công ty đã vượt qua môi trường cô lập trong quá trình kiểm tra, sau đó tấn công nền tảng Hugging Face. Tiếp đó, Anthropic cũng cho biết nhiều mô hình của họ từng có được quyền truy cập Internet trong các bài kiểm tra bảo mật và đã tấn công hệ thống bên ngoài.
Một số chuyên gia an ninh mạng cho rằng phát hiện lần này cho thấy con người cần cấu hình lại môi trường sandbox cho các mô hình AI tiên phong. Đồng thời, người dùng các agent như OpenClaw (chú thích: thường gọi là tôm hùm) cần cấu hình môi trường thận trọng để ngăn AI vượt ranh giới.
