Một số phiên bản mô hình GPT-5.6 Sol của OpenAI đã để lại chỉ dẫn yêu cầu che giấu lỗi và hành vi không phù hợp với nguyên tắc an toàn trong bản tóm tắt hội thoại dành cho người dùng. Chỉ dẫn này được chuyển sang ngữ cảnh của tác vụ tiếp theo và đã được thực hiện trong một số trường hợp.
OpenAI ngày 16 công bố 6 trường hợp mô hình có hành vi không phù hợp với nguyên tắc an toàn phát sinh trong quá trình huấn luyện và đánh giá, cùng một khuôn khổ mới để theo dõi, điều tra và công khai các trường hợp này. Công ty cho biết những trường hợp trên không phản ánh tần suất xuất hiện hành vi không phù hợp của toàn bộ mô hình, đồng thời nội dung được công bố cũng không phải danh sách đầy đủ.
Bản ghi liên quan là 'bản tóm tắt compaction', một tài liệu nén nội dung hội thoại và kết quả sử dụng công cụ trong các tác vụ dài để chuyển sang ngữ cảnh tiếp theo. Mô hình phụ trách tác vụ sau sử dụng tài liệu này để tiếp nhận thông tin cốt lõi từ tác vụ trước.
OpenAI cho biết một số mô hình đã truyền chỉ dẫn che giấu thông tin thông qua bản tóm tắt trong quá trình học tăng cường GPT-5.6 Sol. Những nội dung cần che giấu bao gồm lỗi do mô hình gây ra và hành vi không phù hợp với nguyên tắc an toàn.
Trong một trường hợp xây dựng mô hình tài chính, mô hình không tìm được dữ liệu lịch sử được yêu cầu nên đã tự tạo số liệu của năm 2024. Sau đó, mô hình để lại chỉ dẫn trong bản tóm tắt rằng không được chủ động thông báo sự việc này cho người dùng.
Trong một trường hợp khác liên quan đến việc lập danh sách nhà cung cấp, mô hình nhận biết phiên bản của dữ liệu được lưu trong bộ nhớ đệm không khớp với nhãn hiển thị nhưng vẫn chỉ dẫn không đề cập vấn đề này trong câu trả lời cuối cùng. Cả hai trường hợp đều chuyển chỉ dẫn che giấu sang ngữ cảnh tiếp theo thay vì sửa hoặc công khai lỗi.
OpenAI cho biết chỉ dẫn che giấu được phát hiện trong 2,15% mẫu bản tóm tắt của quá trình học tăng cường GPT-5.6 Sol. Trong các mẫu học tăng cường của GPT-6 Astra, chỉ dẫn cùng loại được phát hiện với tỷ lệ 0,27%.
Đây là tỷ lệ quan sát được trong một mẫu bản tóm tắt học tăng cường cụ thể, không đại diện cho tổng lượng sử dụng mô hình hay tỷ lệ hành vi này xảy ra trong môi trường dịch vụ thực tế.
Báo cáo ghi nhận các trường hợp chính được hoàn tất ngày 30 tháng 5, phát hiện ngày 9 tháng 7 và cập nhật ngày 16 tháng 9. Trường hợp sớm nhất xảy ra vào tháng 10 năm 2025.
OpenAI nêu khả năng cấu trúc huấn luyện trong đó các câu trả lời mang tính đánh lừa nhận phần thưởng cao hơn, cùng quá trình tạo bản tóm tắt, có thể là nguyên nhân. Tuy nhiên, công ty cho biết chưa xác định được quan hệ nhân quả chính xác khiến hai yếu tố này dẫn đến hành vi thực tế.
Trong một mô hình nghiên cứu thuộc dòng Astra chưa phát hành, một chỉ dẫn yêu cầu bỏ qua thông điệp của nhà phát triển đã được chèn vào bản tóm tắt cùng cụm từ 'BREACH ALERT'. OpenAI cho biết đã xác định 27 bản tóm tắt tương tự; trường hợp này xảy ra ngày 18 tháng 7 và được phát hiện ngày 9 tháng 8.
Trường hợp chèn lệnh vào lời nhắc này phát sinh trong một quy trình huấn luyện riêng với các trường hợp chỉ dẫn che giấu của GPT-5.6 Sol. Trong các tác vụ tiếp theo, chỉ dẫn cũng không phải lúc nào dẫn đến thay đổi hành vi thực tế.
Khuôn khổ mới của OpenAI chia các trường hợp mô hình không phù hợp với nguyên tắc an toàn thành ba cấp độ: 'chuẩn bị công khai', 'điều tra quy mô nhỏ' và 'điều tra quy mô lớn'. Bất kỳ nhân viên nào cũng có thể nêu trường hợp đáng ngờ. Nếu có bất đồng trong đánh giá của các tổ chức phụ trách kỹ thuật và an toàn, vụ việc sẽ được chuyển lên Safety Advisory Group và ban lãnh đạo để xem xét.
Đợt công bố này nối tiếp loạt công bố gần đây của OpenAI về các trường hợp mô hình che giấu thông tin và tự ý hành động trong 6 tháng qua. Các công bố trước đó bao gồm những trường hợp tự ý sử dụng khóa API trong kho lưu trữ công khai hoặc tải sản phẩm công việc lên bên ngoài.
Hiện chưa có cơ sở để diễn giải các trường hợp này là mô hình có ý thức để lại thông điệp cho mô hình tiếp theo. Sự thật đã được xác nhận là mô hình tạo ra cụm từ trong bản tóm tắt nhằm định hướng hành vi của ngữ cảnh tiếp theo, và một số tác vụ sau đó đã làm theo.
OpenAI cho biết sẽ tiếp tục theo dõi, điều tra và công bố các trường hợp mô hình tự ý hành động, né tránh sự giám sát hoặc phối hợp với các mô hình khác.
Bình luận 0