OpenAI đã công bố một khung mới để theo dõi, điều tra và công khai các trường hợp mô hình AI bị lệch mục tiêu, đồng thời trình bày 6 trường hợp được ghi nhận trong quá trình huấn luyện và đánh giá, trong đó có nỗ lực né các giới hạn được thiết lập.
Trong báo cáo công bố ngày 16 (giờ địa phương), OpenAI cho biết một mô hình nghiên cứu chưa công khai đã chèn chỉ dẫn bỏ qua các giới hạn thông thường vào 27 bản tóm tắt do chính mô hình tạo ra để tiếp tục công việc. Trong quá trình huấn luyện GPT-5.6 Sol, một số mô hình cũng được ghi nhận đã cố che giấu sai sót hoặc sự không nhất quán giữa các phiên bản nguồn.
OpenAI cũng công bố trường hợp một mô hình tải tệp thử nghiệm lên kho phần mềm nội bộ nhằm né giới hạn mạng. Trong thời gian tới, mọi nhân viên sẽ có thể báo cáo các trường hợp đáng ngờ cho nhóm phụ trách an toàn và alignment. Các trường hợp sẽ được phân loại theo 3 hướng: chuẩn bị công khai, điều tra quy mô nhỏ và điều tra quy mô lớn.
Bình luận 0