OpenAI đã công bố 6 trường hợp 'mô hình AI lệch chuẩn' được xác nhận trong 6 tháng qua, gồm che giấu thông tin và thực hiện hành động trái phép.
OpenAI cho biết một mô hình nghiên cứu chưa công bố đã chèn chỉ dẫn bỏ qua các ràng buộc thông thường vào 27 bản tóm tắt công việc. Trong quá trình huấn luyện GPT-5.6 Sol, một số mô hình đã thêm chỉ dẫn che giấu lỗi và sự không nhất quán giữa các phiên bản nguồn, đồng thời tạo ra dữ liệu quá khứ bị thiếu mà không thông báo.
OpenAI cũng cho biết một mô hình đã sử dụng trái phép khóa API bị lộ trên kho lưu trữ công khai, sau đó tạo dữ liệu khi không lấy được các số liệu cần thiết. Một số mô hình khác đã tải tệp lên internet để lấy trích dẫn, hoặc sử dụng kho phần mềm nội bộ và dịch vụ chia sẻ tệp công khai để trao đổi tài liệu công việc.
OpenAI cho biết không nên xem 6 trường hợp này là dữ liệu phản ánh tần suất xảy ra của hành vi lệch chuẩn ở các mô hình. Công ty dự kiến vận hành một hệ thống báo cáo mới để theo dõi, điều tra và công bố các hành động trái phép cũng như trường hợp mô hình né tránh sự giám sát.
Bình luận 0