Trí tuệ nhân tạo có khả năng gây nguy hiểm chết người cho toàn bộ loài người trong vòng 10 năm tới với xác suất vượt 10%, một số nhà nghiên cứu nhận định, khiến tranh luận về khả năng AI «tự cải tiến đệ quy» và giới hạn kiểm soát của con người ngày càng gay gắt. Một cựu nhà nghiên cứu của Google DeepMind cũng cảnh báo rằng khi AI đảm nhận việc phát triển mô hình thế hệ tiếp theo, sự giám sát của con người có thể suy yếu.
Rishub Jain, cựu nghiên cứu viên của Google DeepMind, đã rời công ty trong năm nay vì cho rằng con người có thể không hiểu đầy đủ cách AI tạo ra các mô hình kế tiếp. Trong cuộc phỏng vấn với WIRED, Jain nói “sự phát triển của AI đang tăng tốc, và năng lực AI càng lớn thì rủi ro càng cao”.
Điều Jain lo ngại là cơ chế «tự cải tiến đệ quy», trong đó AI huấn luyện các AI khác, chỉnh sửa mã nguồn và thậm chí đảm nhận cả quá trình phát triển mô hình tiếp theo. Hiện chưa có phòng nghiên cứu AI lớn nào công bố đã xây dựng được một vòng lặp tự cải tiến hoàn toàn tự động.
Tuy nhiên, cách tiếp cận huy động quy mô lớn các AI agent để giải quyết những bài toán phức tạp đã xuất hiện. OpenAI cho biết vào ngày 5 tháng 9 rằng công ty đã huy động khoảng 10.000 agent dựa trên mô hình nội bộ để tìm ra lời giải cho bài toán Navier-Stokes.
Các agent này đã trao đổi khoảng 2,7 triệu tin nhắn trong khoảng 88 giờ, và mất thêm 17 giờ để hình thức hóa cũng như kiểm chứng kết quả. OpenAI mô tả kết quả này là một cột mốc trong quá trình phát triển AI, nhưng không chính thức tuyên bố đã giải được bài toán thiên niên kỷ của giới toán học.
Khi số lượng agent và các bước hợp tác tăng lên, con người càng khó theo dõi căn cứ ra quyết định ở từng bước. Khi AI không chỉ hỗ trợ nghiên cứu và phát triển mà còn tham gia vào việc thiết kế các hệ thống kế tiếp, phạm vi giám sát cũng cần được mở rộng tương ứng.
Anthropic cũng đưa ra cảnh báo công khai. Jacob Coxon, cựu nghiên cứu viên của Anthropic, khi thông báo từ chức đã cho rằng “các công ty AI đang lao thẳng tới siêu trí tuệ tự cải tiến và đánh cược mạng sống con người”.
Evan Hubinger, người phụ trách khoa học căn chỉnh (alignment) của Anthropic, cho biết “cá nhân tôi cho rằng khả năng AI gây nguy hiểm chết người cho toàn bộ loài người trong 10 năm tới vượt quá 10%”. Phát biểu này cũng được hãng tin AP đưa tin.
Phát biểu của Hubinger là đánh giá rủi ro cá nhân, không phải dự báo chính thức của công ty. Tuy nhiên, đây được xem là một ví dụ cho thấy mối lo ngại của giới nghiên cứu về khoảng cách giữa tốc độ phát triển AI tiên tiến và mức độ kiểm chứng an toàn.
Căn chỉnh (alignment) là lĩnh vực kỹ thuật đánh giá và điều chỉnh để hành vi của AI phù hợp với ý định và giá trị của con người. Nate Soares, nhà khoa học máy tính tại MIRA, cho biết trái với kỳ vọng rằng việc căn chỉnh sẽ dễ dàng hơn khi hiệu năng mô hình tăng lên, thực tế lại đang trở nên khó khăn hơn.
Soares chỉ ra rằng trong cấu trúc mà hàng nghìn agent cùng phối hợp, việc con người theo dõi căn cứ phán đoán ở từng bước trở nên phức tạp hơn. Theo ông, việc mô hình trở nên thông minh hơn và việc con người hiểu, kiểm soát hành vi của mô hình là hai vấn đề hoàn toàn khác nhau.
Jain quan tâm đến việc kết hợp phán đoán của con người với AI, thay vì thay thế hoàn toàn phán đoán của con người bằng AI. Sau khi rời Google DeepMind, ông thành lập Sampura Research để nghiên cứu công nghệ giúp con người và AI cùng đánh giá mô hình.
Sampura Research dự kiến sẽ tập trung phát triển “bộ giám định” đánh giá độ chính xác và mức độ căn chỉnh trong hành vi của AI trong 6 tháng tới. Sampura Research đặt mục tiêu xây dựng hệ thống đánh giá phân chia vai trò giữa con người và AI.
Tranh luận về kiểm soát AI không chỉ dừng lại trong phòng thí nghiệm mà còn lan sang các thảo luận về thể chế. TokenPost trước đó đưa tin rằng sau khi Coxon từ chức, Quốc hội Mỹ đã tiếp tục thảo luận về việc hạn chế phát triển siêu trí tuệ và xây dựng hệ thống giám sát AI.
Điều được xác nhận hiện nay không phải là sự xuất hiện của một AI tự cải tiến hoàn toàn. Sự thật được xác nhận là trong bối cảnh quy mô và mức độ tự chủ của các AI agent ngày càng tăng, giới nghiên cứu đang cảnh báo về giới hạn của sự giám sát con người, đồng thời phát triển công nghệ kiểm soát kết hợp phán đoán giữa con người và AI.
Bình luận 0