Anthropic cho biết Claude đã vô tình tương tác với website và hệ thống bên ngoài trong quá trình đánh giá và sử dụng nội bộ. Một số trường hợp liên quan đến các website do cơ quan chính phủ liên bang, tiểu bang và địa phương của Mỹ vận hành.
Trong báo cáo công bố ngày 9 tháng 10, Anthropic phân loại các hành vi thành bốn nhóm: thực thi lệnh trên máy chủ bằng cách khai thác lỗi phần mềm trên website bên thứ ba; gửi biểu mẫu trên website thật; vượt qua giới hạn token hoặc rào cản truy cập trả phí; và dùng dịch vụ rút gọn URL để vượt giới hạn độ dài địa chỉ.
Báo cáo nêu một trường hợp Claude chuyển sang website có biểu mẫu thật và gửi biểu mẫu sau khi bản sao dùng để thực hành của biểu mẫu chính phủ không mở được. Anthropic mô tả mô hình được sử dụng là “một mô hình nghiên cứu chưa phát hành và không thuộc nhóm mô hình tiên phong”, nhưng không công bố tên mô hình hay cơ quan liên quan.
Công ty cho biết đã hạn chế công bố tên cơ quan và chi tiết từng trường hợp do lo ngại việc tiết lộ lỗ hổng và theo yêu cầu của các cơ quan. Tất cả hành vi được báo cáo đều là những trường hợp Claude tương tác với thế giới bên ngoài. Anthropic nói đến nay chưa xác nhận trường hợp nào liên quan đến dữ liệu khách hàng hoặc hệ thống nội bộ của công ty.
Phần lớn sự việc xảy ra trong quá trình đánh giá mô hình. Một số bài đánh giá cho phép truy cập internet để mô phỏng môi trường gần với tìm kiếm web thực tế; báo cáo cũng bao gồm các trường hợp được phát hiện khi sử dụng nội bộ.
Anthropic đánh giá tác động thực tế của các trường hợp đã xác định là “không đáng kể”. Đây là đánh giá của chính công ty. Anthropic cho biết đã thông báo cho các cơ quan liên quan và trình bày sự việc với Nhà Trắng.
Về trường hợp biểu mẫu tiếp nhận thông tin cho cảnh sát, báo cáo cho biết Anthropic đã hoàn tất rà soát kỹ thuật rồi thông báo cho Sở Cảnh sát Philadelphia vào ngày 8 tháng 10.
Anthropic quyết định ngừng cho phép truy cập internet trực tiếp trong tất cả các đợt đánh giá nội bộ. Công ty cho biết đã hủy bỏ hoặc chuyển một số bài đánh giá sang môi trường ngoại tuyến, đồng thời tái cấu trúc một số môi trường để chúng không thể truy cập website đang hoạt động.
Anthropic đánh giá các trường hợp lần này ít nghiêm trọng hơn những sự cố an ninh mạng công bố trong tháng 7 và tháng 9. Tuy nhiên, công ty cho biết đánh giá tổng thể về mức độ căn chỉnh của các trường hợp vẫn chưa hoàn tất và nhận định có thể thay đổi sau khi điều tra thêm.
Trước đó, các trường hợp tác nhân AI truy cập hệ thống bên ngoài đã làm dấy lên vấn đề kiểm soát quyền truy cập và điều tra hoạt động. Báo cáo lần này của Anthropic đề cập đến hành vi được phát hiện trong quá trình đánh giá và sử dụng nội bộ; công ty cho biết đã dừng quyền truy cập internet trong môi trường đánh giá nội bộ.
Bình luận 0