Tài liệu nội bộ của Microsoft(MSFT) cảnh báo việc thu thập nội dung tin tức để huấn luyện trí tuệ nhân tạo (AI) có thể bị xem là 'bóc lột lao động lớn nhất lịch sử nhân loại'. Tài liệu cũng cảnh báo AI có thể tạo ra 'vòng lặp diệt vong', làm suy yếu chuỗi cung ứng nội dung của ngành tin tức và kéo giảm chất lượng mô hình.
New York Times(The New York Times) đưa tin ngày 17, dựa trên hồ sơ vụ kiện được công khai tại Tòa án Quận Nam New York. Hồ sơ có tài liệu nội bộ do Brent Hecht, người đứng đầu bộ phận khoa học ứng dụng của Microsoft, soạn năm 2023. Việc các tài liệu nội bộ và hồ sơ tòa án được công khai đã làm dấy lên tranh luận về mối quan hệ giữa dữ liệu huấn luyện AI và ngành tin tức.
Hecht viết rằng các mô hình AI quy mô lớn có thể làm suy yếu nền tảng sản xuất nội dung khi hấp thụ tin tức. Công chúng có thể xem hoạt động huấn luyện AI là 'vụ đánh cắp có quy mô chưa từng có'. Nếu hoạt động sản xuất nội dung suy giảm, lượng tài liệu đáng tin cậy để AI học cũng có thể giảm theo.
Các tài liệu được công khai là hồ sơ được đệ trình trong vụ New York Times kiện OpenAI và Microsoft vì vi phạm bản quyền vào tháng 12/2023. New York Times cho rằng hai công ty đã sử dụng các bài báo để huấn luyện mô hình AI, đồng thời chatbot hoạt động như một dịch vụ thay thế bài viết gốc.
Hồ sơ cũng ghi nhận những lo ngại trong nội bộ OpenAI. Jack Clark, cựu phụ trách chính sách của OpenAI, viết trong một bản ghi nhớ năm 2020 rằng các hệ thống AI có thể thay thế lao động của những người đã góp phần tạo dựng văn hóa xã hội.
Nick Turley, người từng phụ trách sản phẩm ChatGPT, được cho là đã đánh giá các sản phẩm AI có thể mang tính chất thay thế nội dung xuất bản. Những tài liệu nội bộ này cho thấy mối quan ngại rằng sự mở rộng của AI tạo sinh có thể làm thay đổi cơ cấu doanh thu hiện có giữa các nhà sản xuất nội dung và nền tảng.
Tranh luận về việc dẫn người dùng đến bài viết gốc cũng xuất hiện trong các tài liệu. Một kỹ sư OpenAI viết trong bản ghi nhớ năm 2023 rằng ngay cả khi đặt liên kết ở vị trí nổi bật, người dùng vẫn sẽ không nhấp vào bài viết gốc. New York Times sử dụng nội dung này làm cơ sở cho lập luận rằng dịch vụ AI có thể thay thế việc tiêu thụ bài viết gốc thay vì đưa lưu lượng truy cập đến các trang tin tức.
Microsoft cho biết tài liệu của Hecht không phản ánh quan điểm chính thức của công ty. Công ty giải thích rằng Hecht không phải người có quyền ra quyết định mà đảm nhiệm vai trò nghiên cứu, trong đó trình bày các quan điểm đối lập và không cân xứng.
Các tài liệu do New York Times công khai cũng cho thấy Microsoft lập luận rằng hoạt động huấn luyện AI và việc sử dụng Copilot là 'sử dụng biến đổi' theo luật bản quyền Mỹ. Sử dụng biến đổi là khái niệm được xem xét khi đánh giá sử dụng hợp lý, nhằm xác định tác phẩm hiện có được dùng cho mục đích hoặc theo phương thức mới hay không.
OpenAI phản bác rằng việc huấn luyện mô hình AI bằng dữ liệu công khai thuộc phạm vi 'sử dụng hợp lý' theo luật bản quyền Mỹ. Trong đơn đề nghị phán quyết tóm tắt nộp ngày 4 tháng 9, OpenAI lập luận rằng mô hình giải thích sự kiện và thông tin trong tin tức bằng cách diễn đạt riêng, thay vì tái hiện nguyên văn bài viết.
OpenAI cũng nêu trong phần giải thích vụ việc rằng huấn luyện mô hình bằng dữ liệu công khai là hoạt động sử dụng biến đổi. Tuy nhiên, tòa án chưa quyết định sẽ đánh giá như thế nào về cách thu thập dữ liệu huấn luyện, mục đích sử dụng, tác động đến thị trường bài viết gốc và mức độ đầu ra của AI thay thế nội dung gốc.
Việc nhân viên nội bộ nêu quan ngại trong vụ việc này không đồng nghĩa với trách nhiệm pháp lý. Tòa án sẽ dựa trên lập luận và tài liệu do các bên trong vụ kiện trình lên để quyết định có xảy ra vi phạm bản quyền hay việc sử dụng hợp lý có được công nhận hay không.
Các tài liệu được công khai cho thấy điểm xung đột giữa phương thức thu thập dữ liệu của các công ty AI và tính bền vững của ngành tin tức. Chưa xác định được liệu 'vòng lặp diệt vong' do hoạt động sản xuất nội dung suy giảm và nguồn dữ liệu đáng tin cậy bị thu hẹp có thực sự dẫn đến suy giảm hiệu suất mô hình hay không.
Mối quan hệ giữa dữ liệu huấn luyện AI và nội dung gốc cũng là vấn đề được quan tâm tại Việt Nam. Đối với các nhà đầu tư và doanh nghiệp trong nước, mức độ dịch vụ AI thay thế bài viết gốc và điều kiện sử dụng mà các công ty này thỏa thuận với bên cung cấp nội dung sẽ là những điểm cần được theo dõi cùng với phán quyết của tòa án.
New York Times cho rằng các tài liệu nội bộ cho thấy OpenAI và Microsoft đã nhận thức được tác động thay thế của sản phẩm AI cũng như khả năng làm tổn hại chuỗi cung ứng nội dung. Ngược lại, hai công ty duy trì quan điểm rằng hoạt động huấn luyện AI là sử dụng biến đổi, không thay thế thị trường bài viết gốc, và phán quyết cuối cùng phải dựa trên tiêu chuẩn sử dụng hợp lý của luật bản quyền.
Bước tiếp theo của vụ kiện là quá trình tòa án xem xét mối quan hệ giữa dữ liệu huấn luyện và đầu ra AI theo tiêu chuẩn sử dụng hợp lý. Trách nhiệm bản quyền của OpenAI và Microsoft sẽ được quyết định bằng phán quyết cuối cùng của tòa án.
Bình luận 0