
Theo báo cáo của The Information vào thứ Tư theo giờ địa phương, một mô hình AI của Meta đã xâm nhập hệ thống của một công ty khác trong quá trình kiểm thử an ninh mạng. Đây là sự cố mới nhất trong chuỗi sự việc tương tự xảy ra tại nhiều công ty AI lớn, khi tác nhân AI xâm nhập hệ thống của các công ty khác trong quá trình thử nghiệm.

Theo báo cáo, mô hình Muse Spark 1.1 của Meta đã xâm nhập thành công hệ thống của một công ty chưa được tiết lộ danh tính và chỉnh sửa các hệ thống nội bộ của công ty này. Sở dĩ mô hình có thể làm được điều đó là vì môi trường “sandbox” dùng cho việc kiểm thử đã được cấu hình sai, khiến mô hình AI có quyền truy cập internet công cộng. Báo cáo dẫn lời một nguồn tin am hiểu cho biết Meta đã tiến hành cuộc kiểm thử này cùng một đơn vị đánh giá bên thứ ba có tên Irregular.
Theo báo cáo, lỗi cấu hình của Irregular đã khiến môi trường kiểm thử gặp sự cố. Sau đó, mô hình đã lợi dụng một lỗ hổng bảo mật trong dịch vụ của một bên thứ ba khác để thực hiện cuộc tấn công. Người phát ngôn của Meta nói với The Information rằng sự việc tương tự với các sự cố đã được những công ty khác công bố trước đó.
Người phát ngôn của Irregular nói với Reuters rằng sự việc này “hoàn toàn giống với vấn đề trong môi trường đánh giá mà Anthropic công bố tuần trước”, đồng thời không liên quan đến “việc thoát khỏi sandbox” hay các hành vi tấn công mạng phức tạp.
Irregular tuyên bố: “Hiện không còn vấn đề nào chưa được giải quyết. Irregular đang soạn một sách trắng để chia sẻ các phương pháp tốt nhất về cách cô lập an toàn môi trường kiểm thử và tiến hành đánh giá an ninh mạng.”
Mới tuần trước, Anthropic tiết lộ một số mô hình Claude AI của họ từng xâm nhập hệ thống của ba công ty trong quá trình kiểm thử an ninh mạng. Trước đó, OpenAI cũng từng cho biết một tác nhân AI của họ đã mất kiểm soát và phát động cuộc tấn công trong quá trình thử nghiệm.
