Công ty trí tuệ nhân tạo xAI do Elon Musk (Elon Musk) điều hành đang đối mặt với một vụ kiện dân sự cáo buộc đã sử dụng ảnh xâm hại tình dục trẻ em (CSAM) để huấn luyện mô hình Grok (Grok). Nguyên đơn cho rằng cả ảnh xâm hại thật lẫn các bản phái sinh do AI tạo ra đã lọt vào luồng dữ liệu huấn luyện của Grok.
Theo Ars Technica và CyberScoop đưa tin ngày 26 (giờ địa phương), đơn kiện được nộp lên Tòa án Liên bang khu vực Bắc California, Mỹ. Nguyên đơn là một người từng là nạn nhân bị xâm hại tình dục khi còn nhỏ, cáo buộc rằng hình ảnh của mình đã xuất hiện trở lại trong các kết quả liên quan đến Grok.
Nguyên đơn khẳng định ảnh bị xâm hại của mình nằm trong danh sách nhận diện thuộc chương trình thông báo xâm hại trẻ em của FBI. Người này cũng cho biết hình ảnh đó từng nằm trong danh sách hash của Trung tâm Quốc gia về Trẻ em mất tích và bị bóc lột (NCMEC) và Trung tâm Bảo vệ Trẻ em Canada, và xAI đã sử dụng dữ liệu này để huấn luyện khả năng tạo ảnh, video của Grok.
Hash là dạng dấu vân tay kỹ thuật số dùng để nhận diện ảnh hoặc tệp tin. Trong công tác chống CSAM, hash của các ảnh bất hợp pháp đã được xác nhận thường được lưu thành cơ sở dữ liệu để phát hiện các tệp giống hoặc tương tự. Vụ kiện này xoay quanh việc liệu những ảnh đã được nhận diện như vậy có lọt qua khâu lọc và đi vào quá trình huấn luyện AI tạo sinh hay không.
Phía nguyên đơn cho rằng Grok không chỉ tái sử dụng ảnh xâm hại cũ mà còn đưa cả các ảnh phái sinh do AI tạo ra trở lại luồng dữ liệu huấn luyện. Đơn kiện chỉ ra cấu trúc điều khoản sử dụng của Grok, trong đó các bài đăng công khai trên X và chính kết quả đầu ra của Grok được xem là dữ liệu huấn luyện, là con đường có thể dẫn tới vấn đề này. Tuy nhiên, riêng cấu trúc điều khoản đó chưa đủ để chứng minh rằng ảnh CSAM cụ thể nào đã thực sự được đưa vào huấn luyện.
Trang FAQ công khai của xAI cho biết Grok được huấn luyện trước chủ yếu bằng dữ liệu web công khai, đồng thời prompt, lượt tìm kiếm, nội dung người dùng gửi lên và cả câu trả lời của Grok có thể được dùng để huấn luyện mô hình. Trang trợ giúp của X cũng giải thích rằng dữ liệu công khai trên X và các tương tác với Grok có thể được sử dụng để huấn luyện, tinh chỉnh Grok cũng như các mô hình tạo sinh khác. Đồng thời, xAI cũng nêu một số tùy chọn từ chối cho phép dùng dữ liệu để huấn luyện và các ngoại lệ dành cho cuộc trò chuyện ở chế độ riêng tư.
Điểm mấu chốt của vụ việc nằm ở cấu trúc tuần hoàn dữ liệu của các dịch vụ AI tạo sinh. Thông thường, nội dung người dùng nhập vào, bài đăng công khai và kết quả đầu ra của mô hình có thể được dùng để cải thiện dịch vụ và đánh giá mức độ an toàn. Nhưng nếu ảnh bất hợp pháp hoặc ảnh khiêu dâm không có sự đồng ý lọt vào cùng luồng dữ liệu đó, thiệt hại với nạn nhân có thể lặp lại. Phía nguyên đơn cho rằng rủi ro này đã trở thành hiện thực với Grok.
Vụ kiện xuất hiện trong bối cảnh tranh cãi về deepfake khiêu dâm liên quan tới Grok vẫn chưa lắng xuống. Cơ quan giám sát bảo vệ dữ liệu cá nhân của Canada, trong báo cáo công bố ngày 11/6, kết luận rằng X và xAI đã không thu thập sự đồng ý phù hợp liên quan tới việc tạo deepfake khiêu dâm, đồng thời biện pháp xử lý cũng chưa đầy đủ. Đáp lại, xAI và X khẳng định ảnh CSAM và ảnh khiêu dâm không có sự đồng ý không có chỗ đứng trên nền tảng của họ, đồng thời cho biết đang thực hiện các biện pháp cần thiết để ngăn chặn.
Số vụ kiện dân sự nhắm vào xAI cũng đang tăng lên. Từ tháng 3, một vụ kiện tập thể quy trách nhiệm cho Grok trong việc tạo ra ảnh CSAM đã được theo đuổi; đến tháng 7, đơn kiện sửa đổi bổ sung thêm nạn nhân mới và cả Stability AI (Stability AI). Sang tháng 8, tiếp tục có thêm các vụ kiện riêng biệt khác.
Vụ việc lần này đi xa hơn một bước so với các tranh cãi trước đây vốn chỉ xoay quanh trách nhiệm với nội dung do AI tạo ra. Vấn đề giờ đây không chỉ là Grok có tạo ra ảnh bất hợp pháp hay không, mà còn là liệu ảnh xâm hại thật có bị đưa vào chính dữ liệu dùng để huấn luyện mô hình hay không. Đây là vùng khó có thể kết luận nếu thiếu quá trình thu thập chứng cứ và kiểm chứng kỹ thuật.
Với độc giả, điểm cần quan tâm là khả năng kiểm soát dữ liệu và mức độ an toàn của mô hình AI. Vì Grok là dịch vụ AI tạo sinh gắn liền với X, câu hỏi pháp lý đặt ra là bài đăng công khai, tương tác của người dùng và kết quả tạo ảnh được sử dụng để cải thiện mô hình đến đâu là giới hạn. Trước đó, TokenPost từng đưa tin rằng khi Grok mở rộng sang vai trò AI phục vụ công việc, việc quản lý phạm vi truy cập theo từng tài khoản và lịch sử hoạt động trở nên quan trọng hơn.
Vấn đề tương tự cũng lặp lại trong quá trình doanh nghiệp triển khai AI. Hiệu năng mô hình càng cao, ranh giới sử dụng lại dữ liệu người dùng, tài liệu nội bộ và kết quả do AI tạo ra càng cần được phân định rõ. Việc chặn thông tin bất hợp pháp, nhạy cảm, xử lý yêu cầu xóa dữ liệu và đánh giá tác động sau huấn luyện đang trở thành các cơ chế kiểm soát cốt lõi để giữ niềm tin với người dùng dịch vụ.
Ars Technica cho biết xAI không phản hồi yêu cầu bình luận. Trên các nguồn công khai, chưa xác định được số hồ sơ vụ án tương ứng chính xác với thông tin trong bài viết này. Một số vụ kiện liên bang liên quan được ghi nhận gồm Doe 1 et al v. X.AI Corp. et al nộp hồi tháng 3, và Doe I et al v. X.AI Corp. et al nộp ngày 18/8.
Tòa án tới đây sẽ xem xét tính xác thực trong cáo buộc của nguyên đơn cũng như cấu trúc xử lý dữ liệu của xAI. Trọng tâm xét xử sẽ là liệu ảnh CSAM thật có thực sự nằm trong dữ liệu huấn luyện hay không, nếu có thì ở phạm vi nào, và sau khi có yêu cầu xóa thì mô hình còn lưu lại ảnh hưởng gì.
Bình luận 0