Amazon(AMZN) bị cáo buộc mua gom số lượng lớn sách hiếm và sách đã ngừng xuất bản, cắt gáy để scan tốc độ cao phục vụ huấn luyện trí tuệ nhân tạo (AI), sau đó hủy bỏ bản gốc. Vụ việc cho thấy các hãng công nghệ lớn không chỉ săn tìm dữ liệu trên mạng mà còn nhắm đến cả tài sản tri thức vật lý để phục vụ AI, khiến giới quan sát lo ngại.
404 Media cho biết đã lần theo một lô hàng khoảng 1.000 cuốn sách do một người bán sách ở California gửi đi, và phát hiện lô hàng này được chuyển đến cơ sở VGT3 của Amazon tại Las Vegas. 404 Media cho biết đã gắn thiết bị định vị AirTag vào kiện hàng để theo dõi hành trình, và tại cơ sở này sách bị cắt gáy trước khi đưa vào máy scan tốc độ cao.
Amazon xác nhận công ty có thu mua sách phục vụ "các nỗ lực liên quan đến công nghệ", nhưng không công bố quy mô thu mua cũng như việc dữ liệu scan được dùng cho dịch vụ AI nào. Báo cáo cũng nêu chi tiết rằng sách sau khi scan bị tiêu hủy.
Vấn đề gây tranh cãi không nằm ở quyền sở hữu sách, mà ở cách thức thu thập dữ liệu huấn luyện. Phần lớn sách xuất hiện trong báo cáo được xuất bản trước năm 2022. Giới quan sát cho rằng nhu cầu tìm kiếm văn bản do con người viết trước khi AI tạo sinh phổ biến rộng rãi đang tăng lên, và đó là lý do các công ty AI lùng mua sách cũ.
Lo ngại rằng văn bản do AI tạo ra bị lẫn ngược vào dữ liệu huấn luyện có thể làm giảm chất lượng mô hình cũng góp phần đẩy nhu cầu này lên cao. Với các công ty phát triển AI, chỉ dựa vào văn bản công khai trên mạng khó tránh được đồng thời ba vấn đề: bản quyền, chất lượng và trùng lặp nội dung.
Cốt lõi tranh cãi nằm ở phương pháp gọi là 'scan phá hủy'. Thay vì mở từng trang để chụp ảnh, người ta cắt gáy sách thành từng tờ rời rồi đưa vào máy scan tốc độ cao, giúp xử lý nhanh hơn nhiều. Nhưng cách làm này đồng nghĩa bản gốc không còn được giữ lại.
Với sách hiếm và sách đã ngừng xuất bản, việc tìm lại đúng bản sách đó gần như không thể. Đây là lý do tranh cãi lần này vượt ra khỏi phạm vi thu thập dữ liệu thông thường. Nhiều ý kiến cho rằng giá trị bảo tồn văn hóa có thể bị tổn hại, tách biệt hoàn toàn với vấn đề bản quyền.
Một cách làm tương tự từng được nhắc đến trong trường hợp của Anthropic. Trong quá trình xây dựng mô hình Claude, Anthropic được cho là đã mua số lượng lớn sách in, tháo gáy để scan rồi hủy bản gốc.
Tuy nhiên, báo cáo về Amazon lần này và trường hợp Anthropic là hai vụ việc riêng biệt. Quy mô thu mua sách của Amazon cũng như phạm vi sử dụng dữ liệu scan cần được xác minh độc lập.
Trong vụ kiện bản quyền liên quan đến Anthropic, tòa án Mỹ từng phán quyết rằng việc scan sách đã mua hợp pháp để huấn luyện AI rồi hủy bản gốc có thể được xem là sử dụng hợp lý (fair use) trong một số bối cảnh nhất định. Dù vậy, phán quyết này không giải quyết được vấn đề bảo tồn sách hiếm. Tranh chấp bản quyền và vấn đề bảo tồn văn hóa là hai câu chuyện khác nhau.
Với độc giả tại Việt Nam, sự việc này không chỉ dừng lại ở một tranh cãi công nghệ ở nước ngoài. Trước đó, Twitch, nền tảng thuộc sở hữu của Amazon, từng vướng tranh cãi khi mặc định bật tính năng cho phép nội dung của nhà sáng tạo được dùng để huấn luyện AI tạo sinh.
Nếu vụ Twitch xoay quanh cơ chế đồng thuận đối với nội dung của người dùng, thì báo cáo về việc thu mua sách lần này mở rộng câu hỏi sang cách bảo tồn tài liệu vật lý. Cuộc đua dữ liệu của các công ty AI đang chạm đến cùng lúc nhiều vấn đề: sự đồng thuận của người sáng tạo, bản quyền và chuẩn mực bảo tồn tài sản văn hóa.
Quy mô thu mua sách của Amazon, mục đích sử dụng cụ thể của dữ liệu scan, cũng như mức độ hiếm có của những cuốn sách bị hủy đến nay vẫn chưa được công bố. Bình luận từ giới quan sát cho rằng báo cáo lần này cho thấy cuộc đua thu thập dữ liệu huấn luyện AI đang lan rộng, từ bài đăng trực tuyến, video, tin nhắn cho đến cả vấn đề bảo tồn ấn phẩm in.
Bình luận 0