21 nhà nghiên cứu, trong đó có các nhà khoa học từ Google DeepMind và Đại học Harvard, vừa công bố một sách trắng xem xét trải nghiệm thị giác như một hướng đi cốt lõi cho nghiên cứu trí tuệ nhân tạo tổng quát (AGI). Sách trắng không nêu tên một mô hình cụ thể nào, cũng không đưa ra mốc thời gian đạt được AGI.
Nhóm nghiên cứu do Hirokatsu Kataoka dẫn đầu đã công bố tài liệu “Visual General Intelligence: A White Paper” vào ngày 26 tháng 8. Danh sách tác giả còn có nhà nghiên cứu Robert Geirhos của Google DeepMind và nhà nghiên cứu Yilun Du của Đại học Harvard.
Khái niệm “trí tuệ tổng quát thị giác” (VGI) mà sách trắng đưa ra không ám chỉ một mô hình hay kiến trúc duy nhất. Đây là một hướng nghiên cứu giúp hệ thống học cách dự đoán, tạo sinh, phục hồi, hiểu không gian và hành động dựa trên dữ liệu hình ảnh, video và hình học.
Nhóm nghiên cứu đặt câu hỏi liệu dữ liệu thị giác có thể hình thành một dạng trí tuệ tương tự như cách nghiên cứu AGI lấy ngôn ngữ làm trung tâm đã mở rộng khả năng khái quát hóa thông qua dự đoán văn bản hay không. Theo nhóm, thông tin thị giác chứa những yếu tố mà ngôn ngữ khó diễn đạt rõ ràng, như hình dạng vật thể, quan hệ không gian, chuyển động và cấu trúc vật lý.
Sách trắng không giới hạn trí tuệ thị giác ở việc nhận diện hình ảnh. Tài liệu này đưa vào phạm vi nghiên cứu các chủ đề như dự đoán tình huống trong tương lai, phục hồi cấu trúc bị che khuất, biểu diễn không gian ba chiều và khả năng học liên tục trong môi trường mới.
Trí tuệ hiện thân (embodied intelligence) và nhận thức chủ động, tức khả năng robot quan sát môi trường xung quanh, hành động rồi phản hồi kết quả trở lại quá trình học, cũng nằm trong nội dung được bàn tới. Điều này cho thấy phạm vi nghiên cứu đã mở rộng ra ngoài việc phân loại thông tin thị giác đơn thuần, hướng tới cả tương tác với môi trường thực tế.
Nhóm nghiên cứu không chủ trương loại bỏ ngôn ngữ. Họ đề xuất lấy thị giác làm trục chính, đồng thời kết hợp với ngôn ngữ, thính giác, xúc giác và cảm giác bản thể theo hướng tiếp cận đa phương thức.
Robert Geirhos, nhà nghiên cứu tại Google DeepMind, viết trong sách trắng: “Các mô hình video tạo sinh sẽ trở thành mô hình nền tảng về thị giác.” Đây là quan điểm cho rằng mô hình video tạo sinh có thể phát triển vượt ra ngoài vai trò công cụ chỉ thực hiện một tác vụ, để trở thành mô hình nền tảng xử lý nhiều bài toán thị giác khác nhau.
Tuy nhiên, phát biểu này không đồng nghĩa với hiệu năng sản phẩm đã được kiểm chứng hay sự đồng thuận của toàn ngành. Sách trắng không đưa ra số liệu hiệu năng cụ thể của các mô hình video tạo sinh, cũng như kế hoạch ra mắt sản phẩm.
Sách trắng cũng nêu rõ rằng định nghĩa, bộ tiêu chuẩn đánh giá (benchmark), phương pháp huấn luyện của VGI, cũng như mối quan hệ giữa thị giác và ngôn ngữ, hiện vẫn chưa được thống nhất. Tài liệu này cũng không đưa ra bằng chứng thực nghiệm cho thấy chỉ riêng trải nghiệm thị giác đã có thể dẫn tới AGI.
Thảo luận này khởi nguồn từ hội thảo CVPR 2026 VGI, diễn ra vào tháng 6 năm 2026. Chương trình chính thức của CVPR có hạng mục hội thảo “Visual General Intelligence”, và thông tin sự kiện của Google Research cũng ghi nhận phiên trình bày về VGI do Geirhos chủ trì.
Trước đó, Google DeepMind từng thảo luận về khung phân loại hiệu năng, tính tổng quát và mức độ tự chủ của AGI, cũng như con đường tiến từ AGI lên siêu trí tuệ. Nghiên cứu AGI của Google DeepMind cũng từng dẫn tới tranh luận về tiêu chuẩn đánh giá hiệu năng, tính tổng quát và mức độ tự chủ.
Sách trắng lần này mở rộng dòng nghiên cứu đó sang góc nhìn về trải nghiệm thị giác và khả năng hiểu thế giới vật lý. Nội dung có thể liên hệ tới các lĩnh vực như video tạo sinh, trí tuệ nhân tạo không gian, học máy cho robot và mô hình thế giới (world model), nhưng không đưa ra lộ trình thương mại hóa cụ thể.
Trước đây, Google DeepMind cũng từng bàn về khả năng tự cải thiện đệ quy như một con đường tiến từ AGI lên siêu trí tuệ. Khả năng tự cải thiện đệ quy sau AGI từng được giới nghiên cứu và đầu tư trong ngành đề cập tới.
Hiện tại, VGI chưa phải là một công nghệ hay sản phẩm hoàn chỉnh, mà là một chương trình nghiên cứu nhằm khám phá điều kiện để việc học thị giác có thể dẫn tới trí tuệ tổng quát. Sách trắng không đề cập tới lịch trình ra mắt mô hình, thời điểm đạt AGI hay mức độ vượt trội về hiệu năng.
Bình luận 0