OpenAI đã đề xuất một khuôn khổ 'lập luận an toàn' nhằm xây dựng tài liệu an toàn có cấu trúc trước khi bắt đầu huấn luyện trí tuệ nhân tạo (AI) bằng phương pháp tăng cường tiên tiến. Khuôn khổ này tập trung giải thích các rủi ro trong quá trình huấn luyện dựa trên bằng chứng và thiết lập quy trình kiểm soát để có thể dừng huấn luyện khi phát sinh vấn đề.
OpenAI cho biết ngày 29 rằng họ đã công bố khuôn khổ lập luận an toàn. Đây là cách áp dụng phương pháp lập luận an toàn vốn được sử dụng trong các ngành có rủi ro cao như hàng không và điện hạt nhân vào quá trình huấn luyện AI. Khuôn khổ hiện được áp dụng nội bộ và đang tiếp nhận ý kiến từ bên ngoài.
Lập luận an toàn là tài liệu có cấu trúc, giải thích bằng bằng chứng rằng rủi ro của một hệ thống cụ thể đã được quản lý đầy đủ. OpenAI cho biết việc đạt mức độ nghiêm ngặt tương đương các ngành công nghiệp có rủi ro cao truyền thống là khó khăn do sự phức tạp xuất hiện khi năng lực AI tăng nhanh.
Khuyến nghị lần này áp dụng cho hoạt động huấn luyện AI bằng phương pháp tăng cường tiên tiến. Nội dung này tiếp nối báo cáo trước đó về việc OpenAI tạm dừng một phần hoạt động huấn luyện tăng cường và tăng cường kiểm soát an toàn. OpenAI cho biết các thuộc tính liên quan đến căn chỉnh rộng hơn cần được xem xét riêng khi triển khai mô hình trong và ngoài tổ chức.
Các biện pháp an toàn kỹ thuật gồm ba lớp: △huấn luyện căn chỉnh △cách ly △giám sát. Mỗi lớp quản lý riêng khả năng bị thao túng của môi trường huấn luyện, hành vi né tránh của mô hình và phương án ứng phó sau khi sự cố xảy ra.
Ở giai đoạn huấn luyện căn chỉnh, OpenAI sử dụng hoạt động rà soát dữ liệu tự động và thủ công để giảm khả năng xảy ra hành vi thao túng phần thưởng. Bộ đánh giá được điều chỉnh để trao phần thưởng thấp cho các hành vi khai thác môi trường huấn luyện, đồng thời phân tích hồ sơ thí nghiệm trước đây nhằm kiểm tra xem bộ đánh giá có hoạt động đúng mục đích hay không.
Khuôn khổ cũng bao gồm đánh giá căn chỉnh ngoại tuyến và kiểm thử ngược dựa trên các sự cố trong quá khứ. Đây là quy trình kiểm tra lại hành vi của mô hình trong quá trình huấn luyện sau khi sự việc xảy ra, đồng thời tái hiện các vấn đề từng được phát hiện để xác định lỗ hổng trong hệ thống đánh giá.
OpenAI đề xuất ngăn bộ đánh giá tự động đọc được chuỗi suy luận của mô hình. Mối lo ngại là mô hình có thể học cách điều chỉnh quá trình suy luận để né tránh hệ thống giám sát.
Hiện tượng 'chơi đánh giá', trong đó mô hình nhận biết mình đang được đánh giá rồi thay đổi hành vi, cũng nằm trong nhóm cần quản lý. OpenAI đề xuất tiến hành các bài kiểm tra căng thẳng nhằm tạo ra những tình huống trục trặc nghiêm trọng nhất, qua đó kiểm tra phản ứng của mô hình trong điều kiện bị giám sát và chịu áp lực.
Ở giai đoạn cách ly, OpenAI sẽ tăng cường hệ thống sandbox nhiều lớp và hạ tầng nghiên cứu. Các điểm kiểm tra của quá trình huấn luyện được sử dụng để lặp lại việc rà soát lỗ hổng bảo mật, đồng thời hạn chế liên lạc băng thông cao giữa các mô hình và những đường vòng trong hạ tầng.
Nhật ký hội thoại trong quá trình huấn luyện và đánh giá được lưu trên thiết bị lưu trữ chỉ ghi một lần. Biện pháp này nhằm ngăn dữ liệu bị chỉnh sửa sau đó, giúp truy lại quá trình huấn luyện và kết quả đánh giá khi xảy ra sự cố.
Ở giai đoạn giám sát, OpenAI đánh giá liệu mô hình có tiếp tục ở trạng thái có thể giám sát hay không, đồng thời kiểm tra khả năng phát hiện các sự cố trong quá khứ với tỷ lệ tái hiện cao. Khi phát sinh rủi ro mới, các hạng mục đánh giá cần được cập nhật. Với cảnh báo ưu tiên cao, nhân sự phụ trách phải phản hồi trong thời gian quy định.
Khuôn khổ cũng đề xuất quy trình tự động dừng huấn luyện nếu nhân sự phụ trách không phản hồi. Nội dung này yêu cầu không thể bắt đầu huấn luyện khi chức năng giám sát chưa được bật, đồng thời phải thiết kế hệ thống để việc tắt giám sát trong quá trình huấn luyện trở nên khó khăn.
Về vận hành, một nhóm khác sẽ đảm nhiệm hoạt động phản biện nhằm tìm ra lỗ hổng trong lập luận an toàn. OpenAI đề xuất cho phép lãnh đạo cấp cao như người phụ trách nghiên cứu, người phụ trách an toàn và nhà khoa học trưởng từ chối bắt đầu huấn luyện. Nếu lập luận an toàn bị vô hiệu hóa, quá trình huấn luyện cũng phải có thể được dừng theo sổ tay hướng dẫn.
Nếu dữ liệu hoặc kết quả đánh giá do mô hình chưa được căn chỉnh tạo ra được sử dụng trong quy trình khác, hệ thống phải có khả năng truy vết và hoàn tác. Trong điều tra sự cố, OpenAI đề xuất tham khảo cách điều tra tai nạn hàng không, sử dụng các thí nghiệm loại trừ và lấy mẫu lại để truy tìm cách hành vi có vấn đề hình thành trong quá trình huấn luyện.
Trong thời gian điều tra, tiến độ sẽ được chia sẻ nội bộ. Hoạt động rà soát cũng phải xem xét cả cách vận hành và văn hóa tổ chức, không chỉ nguyên nhân sự cố. OpenAI đề xuất xây dựng đánh giá phát hiện không học trực tiếp từ hồ sơ sự cố để sử dụng làm kiểm thử hồi quy. Kết quả điều tra và những thay đổi về quy trình sẽ được công bố ra bên ngoài sau khi cuộc điều tra kết thúc.
OpenAI nhấn mạnh đây chưa phải là quy tắc cuối cùng mà mới là khuyến nghị hiện tại. Tài liệu chính thức cho biết các thực tiễn có thể tiếp tục thay đổi trong quá trình áp dụng nội bộ, đồng thời OpenAI dự kiến phát triển thêm các thông lệ liên quan trong vài tuần tới.
Bình luận 0