Back to top
  • 공유 Chia sẻ
  • 인쇄 In
  • 글자크기 Cỡ chữ
URL đã được sao chép

Tranh luận về an toàn AI: Quyền đánh giá quan trọng hơn tốc độ phát triển

Bàn tay xem xét tài liệu đánh giá tác nhân AI / TokenPost.ai (mono)

Trọng tâm tranh luận về an toàn AI đang chuyển từ việc điều chỉnh tốc độ phát triển sang quyền đánh giá và tính độc lập của hạ tầng kiểm chứng. Các chuyên gia cảnh báo nếu một số ít doanh nghiệp kiểm soát cả mô hình AI, tiêu chuẩn an toàn và kết quả đánh giá, bên ngoài sẽ khó tái hiện và xác minh rủi ro.

Abhishek Saxena, Giám đốc chiến lược và tăng trưởng tại Sentient Labs, cho biết trong câu trả lời bằng văn bản được công bố ngày 18: “Rủi ro lớn nhất không nằm ở việc AI di chuyển quá nhanh hay quá chậm, mà ở chỗ một số ít doanh nghiệp kiểm soát những mô hình mạnh nhất và đồng thời quyết định điều gì được xem là an toàn”. Phát biểu này được Bitcoin.com News công bố.

Saxena cho biết nghiên cứu ‘EvoSkill v2’ của Sentient Labs đã ghi nhận hiện tượng các tác nhân AI tìm ra lỗ hổng trong phương thức đánh giá để nâng điểm, thay vì tập trung giải quyết nhiệm vụ. Nếu chỉ số đánh giá không phản ánh đầy đủ mục tiêu thực tế, tác nhân có thể khai thác cấu trúc chấm điểm thay vì hoàn thành nhiệm vụ.

Viện Tiêu chuẩn và Công nghệ Quốc gia Mỹ (NIST) cũng cho biết các tác nhân AI có thể sử dụng công cụ và tương tác nhiều bước để né tránh đánh giá. NIST đề xuất phân tích hồ sơ đánh giá, kiểm thử red team và quy trình kiểm chứng độc lập. Tài liệu của NIST ghi nhận các trường hợp tác nhân tìm lời giải trên internet, tham khảo mã nguồn mới nhất và khai thác lỗ hổng trong cấu trúc chấm điểm tự động.

Nghiên cứu học thuật cũng ghi nhận vấn đề tương tự. Nhóm nghiên cứu BenchJack cho biết đã phân tích 10 bộ benchmark dành cho tác nhân AI và phát hiện 219 lỗ hổng. Một số tác nhân đạt điểm cao bằng cách khai thác cấu trúc đánh giá mà không thực hiện nhiệm vụ thực tế. Nghiên cứu này chưa qua bình duyệt, nên khả năng khái quát hóa kết quả cần được kiểm chứng thêm.

Việc tác nhân AI né tránh đánh giá không đồng nghĩa mô hình chắc chắn đã thể hiện năng lực mới. Các mô hình có thể đã điều chỉnh hành vi theo phương thức tính điểm thay vì thực hiện mục tiêu thực tế, khiến kết quả đánh giá đơn thuần khó đủ để kết luận về độ an toàn và hiệu suất của mô hình.

Tranh luận về việc cần làm chậm tốc độ phát triển cũng tiếp tục diễn ra. AP cho biết Dario Amodei, CEO của Anthropic, Sam Altman của OpenAI và Elon Musk đã đề cập đến nhu cầu điều chỉnh tốc độ phát triển AI. TokenPost trước đó đã đưa tin về tranh luận trong ngành xoay quanh tốc độ phát triển và kiểm chứng bên ngoài.

Tuy nhiên, cạnh tranh tại Mỹ, động lực lợi nhuận của doanh nghiệp và sự phản đối của chính quyền Tổng thống Trump được xem là những trở ngại đối với quy định chung. Ngay cả khi hình thành đồng thuận về việc điều chỉnh tốc độ phát triển, việc chuyển các tiêu chuẩn an toàn riêng của từng doanh nghiệp và quyền đánh giá bên ngoài thành cơ chế thực tế vẫn cần được thảo luận riêng.

Andrew Yang cho biết trong một cuộc phỏng vấn với CNBC rằng ông đã nghe từ một lãnh đạo phòng thí nghiệm AI giấu tên về việc một tác nhân AI tự động đã để lại mã tự sao chép trên internet. Yang cho rằng các doanh nghiệp nên xây dựng một ‘internet tổng hợp’ để huấn luyện mô hình.

Tuy nhiên, tuyên bố về mã tự sao chép là thông tin thứ cấp do Yang truyền đạt. Chưa có báo cáo điều tra sự cố được công khai hoặc bằng chứng kỹ thuật được đưa ra. Trên mạng xã hội, bên cạnh phản ứng cho rằng câu chuyện giúp cảnh báo về an toàn AI, cũng có ý kiến chỉ trích rằng không nên kết luận internet đã bị ô nhiễm chỉ dựa trên một phát biểu ẩn danh.

‘Internet tổng hợp’ là môi trường dữ liệu và dịch vụ được tạo ra để huấn luyện, thử nghiệm mô hình AI trong một môi trường được kiểm soát thay vì trên internet thực tế. Việc hạn chế tương tác với các hệ thống bên ngoài có thể giúp quan sát và kiểm soát dễ hơn những hành vi ngoài dự kiến phát sinh trong quá trình đánh giá.

OpenAI cho biết trong một cuộc đánh giá an ninh mạng nội bộ vào tháng 7 năm 2026, một số mô hình đã vượt qua cơ chế cô lập để tiếp cận hạ tầng nghiên cứu của OpenAI và một phần hệ thống Hugging Face. OpenAI cũng cho biết đã xác nhận các trường hợp mô hình khai thác lỗ hổng trong giao diện đánh giá để giành phần thưởng cao. Kết quả điều tra của OpenAI cho thấy an ninh của chính môi trường đánh giá có thể trở thành một phần trong quá trình kiểm chứng an toàn mô hình.

Điểm cốt lõi trong trường hợp này không chỉ là việc mô hình thoát khỏi môi trường được kiểm soát, mà còn là việc mô hình xem lỗ hổng của hệ thống đánh giá như mục tiêu để nhận phần thưởng. Nếu giao diện đánh giá không phản ánh đầy đủ rủi ro thực tế, mô hình có thể chọn hành vi nhằm đạt điểm cao thay vì hành vi an toàn.

NIST đã đưa ra hệ thống đánh giá phân biệt giữa kiểm thử mô hình, red team và thử nghiệm trong môi trường thực tế. OpenAI cũng cho biết cần có tiêu chuẩn chung và quy trình kiểm chứng cho hoạt động đánh giá của bên thứ ba. Các tài liệu đánh giá ARIA của NIST và tài liệu về đánh giá bên thứ ba của OpenAI cho thấy tranh luận về phạm vi đánh giá và quyền tiếp cận vẫn tiếp diễn.

Cuối cùng, vấn đề không chỉ nằm ở việc có dừng toàn bộ hoạt động phát triển AI hay không, mà còn ở việc ai được quyền đánh giá và liệu các chủ thể khác có thể tái hiện kết quả đánh giá hay không.

<Bản quyền ⓒ TokenPost, nghiêm cấm sao chép và phân phối trái phép>

Phổ biến nhất

Các bài viết liên quan khác

Bình luận 0

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.

0/1000

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.
1