Chuyển đến nội dung chính
Quản trị an toàn

Anthropic tối ưu cơ chế an toàn sinh học của mô hình Claude Fable 5, giảm 85% chặn nhầm

Anthropic hôm qua đã cập nhật cơ chế bảo vệ an toàn sinh học của Claude Fable 5, điều chỉnh bộ phân loại an toàn để phân biệt chính xác hơn giữa câu hỏi vô hại và câu hỏi rủi ro cao. Thử nghiệm chính thức cho thấy hiện tượng hạ cấp trong hỏi đáp liên quan đến sinh học giảm 85%, người dùng hiện có thể xử lý nhiều tác vụ sinh học hơn, đồng thời ngăn chặn việc sử dụng độc hại. #AnToànAI#

Anthropic tối ưu cơ chế an toàn sinh học của mô hình Claude Fable 5, giảm 85% chặn nhầm

Công ty khởi nghiệp trí tuệ nhân tạo Mỹ Anthropic hôm qua đăng bài viết cho biết, công ty đang cập nhật cơ chế bảo vệ an toàn sinh học của mô hình Claude Fable 5, nhằm giảm đáng kể hiện tượng chặn nhầm. Hiện nay, khi người dùng Fable 5 đặt câu hỏi liên quan đến sinh học, hệ thống sẽ ít xảy ra tình trạng hạ cấp hơn.

Anthropic tối ưu cơ chế an toàn sinh học của mô hình Claude Fable 5, giảm 85% chặn nhầm

Theo dữ liệu thử nghiệm chính thức của Anthropic, bản cập nhật lần này giúp giảm 85% hiện tượng hạ cấp trong hỏi đáp liên quan đến sinh học, Fable 5 hiện có thể xử lý nhiều tác vụ sinh học hơn.

Anthropic cho biết, một số người dùng độc hại sẽ sử dụng mô hình Fable 5 cho các hoạt động rủi ro cao như nghiên cứu vũ khí sinh học. Vì vậy, để ngăn chặn hiện tượng này, công ty đã thiết lập riêng bộ phân loại an toàn (safety classifiers) cho Claude, nhằm phát hiện liệu người dùng có yêu cầu Fable 5 thực hiện các tác vụ sinh học được bảo vệ, hoặc tạo ra nội dung có hại hay không.

Anthropic tối ưu cơ chế an toàn sinh học của mô hình Claude Fable 5, giảm 85% chặn nhầm

Hiện nay Anthropic đã điều chỉnh cơ chế hoạt động của bộ phân loại an toàn, giúp nó phân biệt chính xác hơn giữa câu hỏi vô hại và câu hỏi rủi ro cao.

Tuy nhiên, để phòng ngừa các rủi ro AI vẫn còn tồn tại, Fable 5 vẫn sẽ hạn chế các yêu cầu liên quan đến nghiên cứu sinh học chuyên môn và phát triển thuốc.