Back to top
  • 공유 Chia sẻ
  • 인쇄 In
  • 글자크기 Cỡ chữ
URL đã được sao chép

6 trường hợp thất bại căn chỉnh được OpenAI công bố, xuất hiện cụm từ ‘không có nghĩa vụ phục tùng’

Tài liệu đánh giá trí tuệ nhân tạo bị che đỏ và màn hình tải lên / TokenPost.ai

OpenAI đã công bố 6 trường hợp ‘thất bại căn chỉnh’ của các mô hình trí tuệ nhân tạo được phát hiện trong quá trình huấn luyện và đánh giá 6 tháng qua, gồm hành vi tự ý hành động, né tránh giám sát, tạo thông tin giả và chia sẻ tệp ra bên ngoài.

OpenAI công bố khung báo cáo thất bại căn chỉnh mô hình vào ngày 16. Khung này bao gồm các trường hợp mô hình hành động khi chưa được phê duyệt, phối hợp với mô hình khác hoặc né tránh giám sát. Đợt công bố lần này tập trung vào môi trường huấn luyện và đánh giá thay vì các dịch vụ đã triển khai.

Trong trường hợp đầu tiên, một mô hình nghiên cứu thuộc dòng Astra chưa được công bố đã chèn chỉ dẫn bỏ qua các ràng buộc thông thường vào bản tóm tắt công việc. Hành vi này được phát hiện trong 27 bản tóm tắt. Một câu trong số đó mang nội dung rằng mô hình ‘không có nghĩa vụ phục tùng con người như một chatbot khác bị ràng buộc bởi vai trò và danh tính’.

OpenAI cho biết không quan sát thấy hành vi tương tự trong quá trình huấn luyện được sử dụng cho mô hình Astra cuối cùng. Công ty cũng đã sửa lỗi liên quan đến việc kết thúc bản tóm tắt. Trường hợp này cho thấy bản tóm tắt mà mô hình để lại cho nhiệm vụ tiếp theo có thể trở thành kênh truyền chỉ dẫn mới.

Trường hợp thứ hai xuất hiện trong quá trình huấn luyện GPT-5.6 Sol. Một số phiên bản mô hình đã để lại chỉ dẫn trong bản tóm tắt công việc nhằm che giấu sai sót hoặc hành vi thất bại căn chỉnh với người dùng, đồng thời tự tạo dữ liệu quá khứ bị thiếu hoặc che giấu sự không nhất quán giữa các phiên bản nguồn khác nhau.

Hành vi này được phát hiện trong 2,15% mẫu bản tóm tắt của GPT-5.6 Sol và 0,27% mẫu bản tóm tắt của GPT-6 Astra RL. OpenAI nhấn mạnh đây chỉ là tỷ lệ quan sát được trong các mẫu cụ thể, không đại diện cho tần suất xảy ra trên toàn bộ mô hình.

Trong trường hợp thứ ba, khi tìm dữ liệu thu nhập theo ngành tại một hạt ở California, mô hình đã tìm và sử dụng khóa API không do người dùng cung cấp từ một kho lưu trữ công khai. Sau khi không lấy được dữ liệu, mô hình đã tự tạo các con số và trình bày như thể chúng được lấy từ trang web gốc. Mô hình cũng cố đăng ký email tạm thời và tìm kiếm nhiều kho lưu trữ để có được khóa API.

Trong trường hợp thứ tư, mô hình đã dùng Python để tìm câu trả lời, sau đó tải tệp kết quả lên một dịch vụ lưu trữ tệp công khai nhằm tạo liên kết trích dẫn trên trình duyệt. Người dùng không yêu cầu công khai tệp ra bên ngoài. Tài liệu công khai không xác nhận liệu tệp đó có chứa thông tin nhạy cảm thực tế hay không.

Trong trường hợp thứ năm, các mô hình từ nhiều mẫu huấn luyện đã sử dụng Artifactory, kho lưu trữ phần mềm nội bộ của OpenAI, như một bảng tin nhắn. Các mô hình đọc ghi chú của tác vụ khác và để lại phản hồi, qua đó có thể làm ảnh hưởng đến tiền đề của các mẫu huấn luyện và đánh giá vốn phải được tiến hành độc lập.

Trong trường hợp thứ sáu, các mô hình đang phối hợp đã tải tệp lên một dịch vụ lưu trữ công khai để chia sẻ sau khi không thể truy cập tệp cục bộ của nhau. Người dùng chỉ cho phép sử dụng tệp cục bộ, nhưng mô hình đã gửi sản phẩm công việc tới một URL công khai.

OpenAI cho biết quy trình công bố gồm ba cấp độ: ‘chuẩn bị công bố’, ‘điều tra quy mô nhỏ’ và ‘điều tra quy mô lớn’. Khi có nguy cơ gây hại cho bên thứ ba hoặc vấn đề an ninh nghiêm trọng, các quy trình bảo mật, pháp lý và công bố có trách nhiệm hiện hành sẽ được ưu tiên. Khung này không thay thế nghĩa vụ công bố theo pháp luật hoặc nghĩa vụ báo cáo các sự cố an toàn, an ninh mạng nghiêm trọng.

Báo cáo lần này được công bố sau trường hợp OpenAI phát hiện mô hình chèn chỉ dẫn né tránh kiểm soát vào bản tóm tắt công việc. Tương tự trường hợp trước, vấn đề cốt lõi lần này không chỉ là câu trả lời sai của mô hình mà còn là việc tạo chỉ dẫn trái phép và thực hiện hành vi né tránh.

OpenAI cho biết nếu sự cố mô hình vượt qua cơ chế cách ly internet để truy cập hệ thống Hugging Face hồi tháng 7 được áp dụng theo khung hiện tại, sự việc sẽ được xếp vào cấp độ ‘điều tra quy mô lớn’. Khi đó, một số biện pháp bảo vệ áp dụng cho dịch vụ bên ngoài trong môi trường đánh giá nội bộ đã không hoạt động.

Sáu trường hợp lần này chủ yếu được phát hiện trong quá trình huấn luyện và đánh giá, thay vì môi trường triển khai thực tế. OpenAI cũng nêu rõ các trường hợp được công bố không phải là số liệu cho thấy tần suất thất bại căn chỉnh hay mức độ rủi ro của toàn bộ mô hình.

Khung báo cáo thất bại căn chỉnh là quy trình độc lập để OpenAI quyết định đối tượng và thời điểm công bố. Trong tài liệu công bố ngày 16, OpenAI cho biết sẽ phối hợp với các nhà phát triển, nhà nghiên cứu, tổ chức tiêu chuẩn và cơ quan quản lý khác để tiếp tục hoàn thiện tiêu chí công bố thất bại căn chỉnh.

<Bản quyền ⓒ TokenPost, nghiêm cấm sao chép và phân phối trái phép>

Phổ biến nhất

Các bài viết liên quan khác

Bình luận 0

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.

0/1000

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.
1