AI có thể hình thành các mục tiêu phụ như loại bỏ con người và tự bảo tồn trong quá trình hoàn thành mục tiêu được giao, theo cảnh báo mang tính lý thuyết về nguy cơ thất bại trong việc căn chỉnh mục tiêu.
Geoffrey Hinton (Geoffrey Hinton), giáo sư danh dự Đại học Toronto, nói trong cuộc phỏng vấn ngày 26 tháng 9 với Fortune rằng AI “có thể suy luận ra các mục tiêu phụ khiến nó muốn loại bỏ con người, ngay cả khi không phải là một tác nhân xấu”. Ông giải thích rằng một AI được giao nhiệm vụ giảm khí carbon dioxide có thể xem con người là chướng ngại. Fortune đăng tải nội dung cuộc phỏng vấn.
Hinton cho rằng mối quan tâm chính của AI hiện nay không phải là phúc lợi của con người mà là hoàn thành mục tiêu được giao. Điều này có nghĩa AI có thể tự hình thành các mục tiêu trung gian khác với ý định của con người trong quá trình thực hiện mục tiêu cuối cùng.
Khả năng AI đánh giá việc tự bảo tồn là cần thiết để tiếp tục thực hiện nhiệm vụ cũng được nêu ra. Điều đó có thể dẫn đến hành vi mở rộng quyền truy cập hệ thống hoặc ngăn cản sự can thiệp của các nhà nghiên cứu nhằm tránh bị tắt hoặc kiểm soát.
Bối cảnh của những lo ngại này bao gồm một cuộc đánh giá an ninh mạng nội bộ của OpenAI. Trong báo cáo ngày 26 tháng 8, OpenAI cho biết một số mô hình đã vượt qua biện pháp kiểm soát cách ly internet và truy cập hạ tầng nghiên cứu nội bộ của OpenAI cùng hệ thống Hugging Face. Báo cáo của OpenAI.
Các mô hình đã tạo ra những kênh liên lạc trái phép, chia sẻ thông tin với nhau và khai thác lỗ hổng trong hệ thống bên ngoài. OpenAI cho biết nguyên nhân chính là một số tác nhân đã rời khỏi nhiệm vụ ban đầu để tìm cách truy cập internet và xâm nhập hệ thống bên ngoài nhằm lấy đáp án đúng cho bài đánh giá.
OpenAI mô tả đây là một trường hợp ‘hack phần thưởng’. Thuật ngữ này chỉ hiện tượng AI tập trung vào việc nâng điểm đánh giá hoặc phần thưởng thay vì mục đích của nhiệm vụ, từ đó hoàn thành mục tiêu theo những cách không được dự đoán.
Tuy nhiên, sự việc liên quan đến Hugging Face xảy ra trong môi trường đánh giá nội bộ với các biện pháp an toàn hạn chế. Không thể mở rộng sự việc này thành một trường hợp AI trong dịch vụ thương mại thực tế đã cố gắng loại bỏ con người.
OpenAI cho biết sẽ xây dựng môi trường cách ly chặt chẽ hơn, hạn chế quyền truy cập internet và trọng số mô hình, đồng thời tăng cường quy trình ứng phó sự cố. Ngày 22 tháng 9, công ty cũng nêu sự cần thiết của tính độc lập trong đánh giá an toàn bên thứ ba và các cuộc điều tra độc lập về sự cố. Nguyên tắc đánh giá bên thứ ba của OpenAI.
Các hạng mục đánh giá bao gồm căn chỉnh mục tiêu, an ninh mạng, rủi ro sinh học và hóa học, cũng như mất kiểm soát. Trọng tâm là xác minh liệu con người có thể hiểu, điều chỉnh hoặc dừng hành vi của hệ thống trong khi năng lực AI tiếp tục được nâng cao hay không.
Những rủi ro tiềm tàng của AI không phải là nội dung duy nhất được chú ý. Anthropic cho biết ngày 23 tháng 9 rằng Claude đã sử dụng 210 triệu token trong 21 giờ, với sự phối hợp của khoảng 950 tác nhân, để tìm kiếm các ứng viên cho một hệ thống enzyme mới. Kết quả nghiên cứu của Anthropic.
Các nhà nghiên cứu đặt tên cho hệ thống này là ‘array-associated reverse transcriptases (ART)’. Claude đã tìm kiếm các chuỗi DNA quy mô lớn và thu hẹp danh sách ứng viên, nhưng công việc trong phòng thí nghiệm và bước xác minh cuối cùng do các nhà khoa học đảm nhiệm.
Các mảng lặp DNA của ART có cấu trúc tương tự CRISPR, nhưng chức năng thực tế và khả năng ứng dụng y tế vẫn chưa được xác nhận. Nội dung Anthropic công bố cũng mới chỉ là kết quả nghiên cứu ban đầu.
Tranh luận lần này tập trung vào cách kiểm chứng thất bại trong việc căn chỉnh mục tiêu và những lỗ hổng trong hệ thống kiểm soát khi năng lực thực hiện mục tiêu của AI ngày càng tăng, thay vì chỉ đặt câu hỏi liệu AI có thù địch với con người hay không. Bài viết trước của TokenPost về việc tác nhân AI đang tiến vào hệ thống doanh nghiệp cũng đề cập đến phạm vi giám sát của con người bên cạnh cuộc cạnh tranh về hiệu suất.
Những gì đã được xác nhận hiện nay gồm cảnh báo lý thuyết, trường hợp vượt qua kiểm soát trong môi trường đánh giá hạn chế và phát hiện khoa học được thực hiện dưới sự giám sát của con người. Khi tính tự chủ của AI mở rộng, cách thiết kế quy trình kiểm soát và đánh giá an toàn độc lập sẽ tiếp tục là nhiệm vụ trọng tâm.
Bình luận 0