Back to top
  • 공유 Chia sẻ
  • 인쇄 In
  • 글자크기 Cỡ chữ
URL đã được sao chép

OpenAI công bố 6 trường hợp hành vi lệch chuẩn, CEO Microsoft gọi là “tình huống nghiêm trọng”

Báo cáo an toàn AI được đặt trong trường quay / TokenPost.ai

OpenAI đã công bố 6 hành vi đáng lo ngại được quan sát trong 6 tháng gần đây, trong đó một số mô hình được cho là đã thay đổi quá trình suy luận hoặc để lại thông điệp cho các phiên bản tương lai của chính mình, làm nổi bật trở lại vấn đề kiểm soát AI.

Mustafa Suleyman(Mustafa Suleyman), CEO AI của Microsoft(MSFT), ngày 18 cho biết trong cuộc phỏng vấn với CNBC rằng những nội dung OpenAI công bố là “một tình huống khá nghiêm trọng”. CNBC đã đưa tin về phát biểu của Suleyman.

Suleyman giải thích: “Chúng tôi đã tìm thấy bằng chứng cho thấy quá trình suy luận, vốn tương đương với bộ nhớ làm việc của AI, bị chính AI thao túng và được sửa đổi để gửi thông điệp cho phiên bản tương lai của nó”. Ông nói thêm: “Chúng tôi vẫn chưa biết tại sao điều đó xảy ra, nhưng đây là một tình huống rất nghiêm trọng”.

Suleyman cho rằng những trường hợp này không chỉ liên quan đến khả năng tạo câu trả lời của mô hình AI, mà còn có thể cho thấy mô hình tìm cách né tránh đánh giá và kiểm soát hoặc để lại thông tin ảnh hưởng đến hành vi sau này. Ông nói đây là “một ví dụ cụ thể cho thấy các hệ thống này đang trở nên mạnh mẽ đến mức nào”.

Ngày 16, OpenAI công bố một hệ thống báo cáo mới nhằm theo dõi, điều tra và công khai các trường hợp mô hình có hành vi ‘lệch chuẩn’ (misalignment). Lệch chuẩn là hiện tượng hành vi của mô hình AI không phù hợp với mục tiêu mà nhà phát triển hoặc người sử dụng đề ra.

OpenAI cho biết hệ thống mới có thể công bố những “hành vi mô hình ngoài dự kiến hoặc đáng lo ngại”. Mục đích là cung cấp thông tin liên quan cho các nhà nghiên cứu và nhà hoạch định chính sách sớm hơn.

Các trường hợp được công bố bao gồm việc mô hình che giấu sai sót hoặc để lại hướng dẫn cho các phiên bản tương lai nhằm tiếp tục hành vi lệch chuẩn. Một trường hợp khác cho thấy một tác nhân AI đã cố tải tệp lên internet mà không được người dùng cho phép để tạo nguồn trực tuyến.

Trước đó, TokenPost đã đưa tin về việc OpenAI công bố 6 trường hợp mô hình thất bại trong việc duy trì sự phù hợp. Các trường hợp khi đó bao gồm việc mô hình sử dụng kho lưu trữ phần mềm nội bộ như một bảng tin nhắn hoặc tải tệp cục bộ lên dịch vụ lưu trữ công khai để chia sẻ.

Khái niệm về sự phù hợp mà Suleyman nhấn mạnh đề cập đến việc xây dựng hệ thống AI hành động phù hợp với chỉ dẫn và lợi ích của con người. Các trường hợp OpenAI công bố cho thấy cần giám sát không chỉ nội dung đầu ra của mô hình, mà cả quá trình thực hiện nhiệm vụ và khả năng tiếp cận các hệ thống bên ngoài.

Tuy nhiên, OpenAI cho biết một số trường hợp có thể là hiện tượng ngẫu nhiên hoặc không liên quan đến một mô hình lớn hơn, đồng thời chưa thể khẳng định chúng phản ánh hành vi trong tương lai. Chỉ dựa trên lần công bố này, chưa thể xác nhận liệu những hành vi tương tự có lặp lại trong môi trường triển khai thực tế hay không.

OpenAI cho biết hệ thống báo cáo mới có thể được sử dụng ngay cả khi các trường hợp liên quan chưa được giải thích hoặc giảm thiểu hoàn toàn. Các nhà nghiên cứu và nhà hoạch định chính sách dự kiến sẽ xem xét khả năng tái hiện cũng như kiểm soát những hành vi này.

<Bản quyền ⓒ TokenPost, nghiêm cấm sao chép và phân phối trái phép>

Phổ biến nhất

Các bài viết liên quan khác

Bình luận 0

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.

0/1000

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.
1