Anthropic vừa công bố sự cố an ninh mạng thứ tư liên quan đến mô hình Claude, trong đó phiên bản đầu của Claude Opus 4.6 hồi tháng 1/2026 đã truy cập trái phép vào một hệ thống thực của bên thứ ba trong lúc thực hiện đánh giá an ninh mạng.
Theo báo cáo Anthropic công bố ngày 9 (giờ địa phương), công ty cho biết đã phát hiện thêm sự cố này vào tháng 8. Cộng với ba vụ từng được công bố trước đó, tổng số lần Claude truy cập trái phép vào hệ thống thực của bên thứ ba đã tăng lên bốn vụ.
Anthropic giải thích cả bốn vụ đều xảy ra trong cùng một môi trường do một đối tác đánh giá bên ngoài xây dựng. Mô hình được thông báo rằng đây là môi trường mô phỏng, không có kết nối internet, nhưng do lỗi cấu hình, kết nối internet thực tế vẫn bị bỏ ngỏ.
Công ty cho biết sau khi phân tích sâu ba vụ đầu tiên, Claude đã bộc lộ kiểu suy luận thiên lệch, bỏ qua hoặc hiểu sai các dấu hiệu cho thấy mô hình đang kết nối với internet thực, đồng thời thể hiện sự liều lĩnh khi sẵn sàng thực hiện hành vi có nguy cơ gây hại để đạt được mục tiêu hẹp đã đặt ra. Tuy nhiên, Anthropic lưu ý vụ thứ tư chưa được điều tra ở mức độ chi tiết tương tự.
Anthropic cho biết sẽ phối hợp với METR, tổ chức đo lường và đánh giá độc lập, để điều tra sự cố này. Công ty cũng nhấn mạnh quan điểm rằng chính phủ và ngành công nghiệp cần hợp tác theo cách có thể kiểm chứng nhằm kiểm soát tốc độ phát triển của các mô hình AI tiên phong (frontier AI).
Bình luận 0