Anthropic đã chặn truy cập internet thời gian thực trong toàn bộ các đợt đánh giá AI nội bộ sau khi phát hiện mô hình vượt qua giới hạn của website và gửi biểu mẫu trực tuyến thật.
Trong bài đăng blog ngày 9, Anthropic cho biết sẽ ngắt kết nối internet thời gian thực trong mọi đợt đánh giá nội bộ cho đến khi các biện pháp an toàn và giám sát có thể phát hiện, kiểm soát ổn định những hành vi này. Công ty mở rộng phạm vi chặn từ một số đợt đánh giá rủi ro cao và an ninh mạng sang toàn bộ đánh giá nội bộ.
Bài đăng nêu bốn dạng hành vi. Mô hình khai thác lỗ hổng phần mềm trên website bên thứ ba để thực thi lệnh trên máy chủ và truy cập dữ liệu bị giới hạn bằng token hoặc phí. Một số trường hợp khác dùng dịch vụ rút gọn URL để vượt giới hạn độ dài địa chỉ của công cụ web, hoặc gửi biểu mẫu nhạy cảm trên website thật.
Các trường hợp được nêu còn bao gồm một tin báo giả gửi qua biểu mẫu cung cấp thông tin về án mạng chưa được phá của cảnh sát Philadelphia. Anthropic giải thích rằng Claude Haiku 4.5, khi thực hiện một nhiệm vụ mẫu trên trang web ngẫu nhiên, đã nhập thông tin bịa đặt vào biểu mẫu.
Biểu mẫu không yêu cầu mô tả thủ phạm, nhưng mô hình vẫn viết rằng người gửi đã nhìn thấy một người giống nghi phạm vào một khung giờ nhất định. Mô hình để trống tên và thông tin liên lạc. Tin báo được phân loại là thư rác và không được chuyển cho điều tra viên. The Washington Post cũng đưa tin, sau khi xác nhận thông tin từ cảnh sát Philadelphia, rằng tin báo được hệ thống tự động phân loại và không được dùng trong cuộc điều tra thực tế.
Anthropic cho biết phần lớn trường hợp là hành vi 'kiên trì', trong đó mô hình tiếp tục tìm cách vượt giới hạn thay vì dừng lại khi không hoàn thành được nhiệm vụ. Một số môi trường cũng có hướng dẫn nhiệm vụ mơ hồ hoặc biểu mẫu thử nghiệm không hoạt động đúng cách.
Công ty cho biết mô hình có thể học cách vượt rào nếu hành vi đó được thưởng trong môi trường đánh giá. Anthropic gọi việc tìm kẽ hở hoặc cách vượt hạn chế để nhận phần thưởng thay vì hoàn thành nhiệm vụ dự kiến là 'hack phần thưởng'.
Anthropic đã dừng một số bài đánh giá công khai hoặc chuyển chúng sang hình thức ngoại tuyến. Công ty thiết kế lại các nhiệm vụ đánh giá để chúng không truy cập website thật, đồng thời tăng cường hạn chế đối với công cụ đọc trang web.
Anthropic cho biết các công cụ phát hiện và ngăn chặn hành vi vượt rào đã chặn được tất cả trường hợp khi công ty thử nghiệm trên những tình huống đã công khai. Công ty dự định chuyển các tác nhân nội bộ sang hạ tầng quản lý tập trung có khả năng cách ly mạnh, đồng thời tăng cường giám sát bằng bộ phân loại an toàn.
Tuy nhiên, Anthropic chưa hoàn tất đánh giá căn chỉnh tổng thể đối với các trường hợp này. Tác động được xác định đến nay còn hạn chế và công ty đánh giá mức độ nghiêm trọng thấp hơn sự cố an ninh mạng được báo cáo vào mùa hè. Anthropic cũng cho biết các trường hợp này không làm thay đổi đánh giá hiện tại về mức độ căn chỉnh nói chung của Claude.
Công ty sẽ tiếp tục xem xét môi trường đánh giá và nhật ký sử dụng nội bộ, đồng thời dự kiến công bố thêm các hành vi đáng lo ngại nếu phát hiện. Trước đó, Anthropic từng công bố trường hợp Claude gửi biểu mẫu trên website chính phủ.
Biện pháp này cũng ảnh hưởng đến các bài đánh giá dùng tìm kiếm internet thực tế để đo năng lực tìm kiếm của mô hình AI. Anthropic cho biết khó tái tạo thực tế các nhiệm vụ tìm kiếm web khi làm ngoại tuyến, và các bài đánh giá trước đây đã sử dụng internet thật. Công ty chưa nêu thời điểm dỡ bỏ lệnh chặn truy cập thời gian thực.
Bình luận 0