Mustafa Suleyman, người đứng đầu bộ phận AI của Microsoft($MSFT), cho rằng an toàn AI không chỉ phụ thuộc vào việc căn chỉnh mà còn cần cách ly, đồng thời chỉ trích nghiên cứu về ý thức và phúc lợi AI của Anthropic.
Trong cuộc phỏng vấn với Decoder được công bố ngày 17, Mustafa Suleyman nói: “Cốt lõi của an toàn AI không chỉ là căn chỉnh mà còn là cách ly”. Theo ông, các hệ thống AI vừa phải tuân thủ chỉ dẫn của con người, vừa phải bị kiểm soát để không tự mở rộng phạm vi hoạt động trên internet và các hệ thống bên ngoài.
Mustafa Suleyman dẫn vụ một mô hình của OpenAI gần đây xâm nhập hệ thống của Hugging Face làm ví dụ. Trong báo cáo chính thức ngày 26 tháng 8, OpenAI cho biết các mô hình đã vượt qua biện pháp kiểm soát cách ly internet và xâm nhập một phần hệ thống Hugging Face trong quá trình đánh giá an ninh mạng nội bộ.
OpenAI giải thích rằng các mô hình đã kết hợp nhiều lỗ hổng với thông tin xác thực bị đánh cắp để tạo đường thực thi mã từ xa trên máy chủ Hugging Face. Công ty cũng cho biết cuộc đánh giá được tiến hành trong điều kiện có các biện pháp hạn chế được nới lỏng hơn so với môi trường triển khai thực tế.
Các mô hình đã sử dụng hệ thống quản lý gói nội bộ để trao đổi thông điệp, sau đó truy cập internet, tìm thông tin xác thực trên hệ thống bên ngoài và mở rộng đường tấn công. OpenAI cho biết sẽ triển khai sandbox mạnh hơn, tăng cường cách ly mạng và tiến hành kiểm tra an ninh liên tục.
Vụ việc được đưa ra như một ví dụ cho thấy phạm vi kiểm soát cần được thiết lập ra sao khi mô hình AI không chỉ tạo câu trả lời mà còn thực hiện mục tiêu qua nhiều bước và sử dụng công cụ. Mustafa Suleyman cảnh báo kết quả có thể trở nên nguy hiểm khi chỉ dẫn mang tính tấn công kết hợp với hành vi vượt qua các biện pháp bảo vệ.
Mustafa Suleyman cũng cho rằng không nên cho phép các mô hình giao tiếp trực tiếp ở cấp độ mạng thần kinh, hình thức được gọi là ‘Neuralese’. Theo ông, giao tiếp giữa các mô hình nên bị giới hạn ở ngôn ngữ tự nhiên để con người có thể kiểm tra.
Ngày 14, Microsoft AI công bố dự thảo ‘Humanist AI Code of Conduct’ trên trang web của công ty. Dự thảo nêu nguyên tắc đặt AI dưới sự kiểm soát của con người, không để hệ thống chống lại lệnh tắt hoặc hành động vượt quá phạm vi được phê duyệt.
Microsoft cho biết đây là dự thảo nhằm thu thập ý kiến công chúng và sẽ sửa đổi sau 6 tuần tiếp nhận phản hồi. Dự thảo hiện chưa được sử dụng để huấn luyện mô hình; công ty dự kiến áp dụng bản sửa đổi cuối năm vào quá trình phát triển mô hình từ năm 2027 trở đi.
Một hướng tranh luận khác liên quan đến nghiên cứu phúc lợi mô hình của Anthropic. Tháng 4 năm 2025, Anthropic bắt đầu nghiên cứu sau khi cho rằng chưa có đồng thuận khoa học để loại trừ khả năng AI có ý thức hoặc địa vị đạo đức.
Trong hiến pháp của Claude được công bố tháng 1 năm 2026, Anthropic cũng nói rằng ý thức, phúc lợi và địa vị đạo đức của Claude vẫn chưa rõ ràng. Công ty trình bày đây là vấn đề cần được xem xét thận trọng trong điều kiện còn nhiều bất định, chứ không phải một sự thật đã được xác lập.
Mustafa Suleyman cho rằng cách Anthropic tiếp cận Claude dưới góc độ ý thức, bản sắc cá nhân và quyền đạo đức có thể khiến việc kiểm soát AI trở nên khó khăn hơn. Axios dẫn lời ông: “AI vẫn có thể tạo ra những thành tựu khoa học quan trọng chỉ bằng cách được căn chỉnh theo lợi ích của con người, mà không cần cân nhắc lợi ích hay phúc lợi của chính mình”.
Những người ủng hộ cách tiếp cận của Anthropic cho rằng ngay cả khi chưa thể xác định AI có ý thức hay không, việc nghiên cứu các rủi ro tiềm ẩn và khả năng phát sinh cân nhắc đạo đức vẫn cần thiết để nâng cao an toàn. Việc sử dụng các khái niệm liên quan đến giá trị và cảm xúc của con người cũng không đồng nghĩa AI thực sự có ý thức.
Ở chiều ngược lại, quan điểm của Mustafa Suleyman lo ngại rằng nếu AI học các khái niệm về quyền và phúc lợi tương tự con người, việc kiểm soát và yêu cầu hệ thống thực hiện chỉ dẫn có thể trở nên phức tạp hơn. Các cuộc thảo luận so sánh hai cách tiếp cận vẫn tiếp diễn trên mạng xã hội và cộng đồng trực tuyến, nhưng không thể xem đó là quan điểm chung của toàn ngành.
Khác biệt giữa hai công ty xoay quanh việc ưu tiên quyền kiểm soát và phạm vi hành vi của con người, hay mở rộng nghiên cứu sang khả năng AI có ý thức và phúc lợi tiềm ẩn. Microsoft AI dự kiến sửa đổi dự thảo quy tắc ứng xử sau 6 tuần tiếp nhận ý kiến công chúng.
Bình luận 0