Cuộc thảo luận về GLM-5.3 của Zhipu AI đang mở rộng trọng tâm của cuộc đua mô hình trí tuệ nhân tạo (AI) lớn, từ quy mô tham số sang hiệu quả hậu huấn luyện và vận hành thực tế. Ngay cả khi dùng chung một mô hình nền tảng, việc mở rộng môi trường tác vụ dài hạn và học tăng cường có thể tạo ra khác biệt rõ rệt về hiệu năng lập trình và bảo mật.
Tang Jie, nhà sáng lập Zhipu AI (Z.ai), cho biết trong bài viết ngày 19 rằng việc mở rộng mô hình lớn không chỉ nằm ở số lượng tham số, mà còn phải xét đến quy mô dữ liệu, cách phân bổ tài nguyên tính toán, chi phí suy luận và điều kiện vận hành thực tế. TechFlow đưa tin nội dung này vào lúc 11h32 ngày 19 theo giờ Trung Quốc, tương đương 10h32 cùng ngày theo giờ Việt Nam.
Theo Tang Jie, ở giai đoạn đầu của các quy luật mở rộng (scaling laws), tốc độ tăng tham số từng vượt xa tốc độ tăng dữ liệu, kéo theo tình trạng mất cân đối trong phân bổ tài nguyên ở một số mô hình siêu lớn. Xu hướng nghiên cứu sau đó đã chuyển sang hướng để tham số mô hình và dữ liệu huấn luyện tăng trưởng cân bằng hơn.
Yếu tố then chốt được nhấn mạnh là "hậu huấn luyện" (post-training) — quá trình nâng cấp hiệu năng mô hình nền tảng sau khi đã hoàn thiện, thông qua các môi trường tác vụ cụ thể và cơ chế thưởng. Nếu tiền huấn luyện (pre-training) là giai đoạn mở rộng nền tảng ngôn ngữ và kiến thức, thì hậu huấn luyện thiên về điều chỉnh cách trả lời và hành động của mô hình sao cho phù hợp với cách sử dụng thực tế.
Tang Jie cho biết GLM-5.3 sử dụng cùng mô hình nền tảng, cấu trúc, tổng số tham số và số tham số kích hoạt như GLM-5.2. Khác biệt nằm ở quá trình hậu huấn luyện kéo dài một tháng, trong đó Zhipu AI mở rộng môi trường tác vụ dài hạn và học tăng cường.
Cách giải thích này khiến cuộc đua mô hình AI lớn khó có thể quy về một cuộc chạy đua quy mô đơn thuần. Thay vì xây dựng mô hình mới lớn hơn, hướng đi được chú ý hiện nay là gắn thêm chuỗi thực thi dài hơn, nhiều môi trường tác vụ hơn và cơ chế thưởng lên mô hình nền tảng sẵn có để nâng hiệu năng.
Trong các mô hình hỗn hợp chuyên gia (Mixture of Experts), ý nghĩa của tổng tham số và tham số kích hoạt cũng khác nhau. Theo Tang Jie, tổng tham số liên quan đến dung lượng kiến thức mà mô hình có thể chứa, còn tham số kích hoạt và độ sâu hiệu dụng tác động trực tiếp hơn đến năng lực suy luận thực tế. Vì vậy, chỉ dùng một tỷ lệ "token huấn luyện trên mỗi tham số" duy nhất để đánh giá hiệu quả mô hình đã trở nên khó thuyết phục.
Chi phí suy luận cũng được nêu như một biến số quan trọng. Khi mô hình được gọi với tần suất cao, chi phí thực tế có thể tích lũy mạnh hơn ở giai đoạn vận hành dịch vụ so với giai đoạn huấn luyện. Trong trường hợp này, chiến lược huấn luyện một mô hình nhỏ hơn trong thời gian dài hơn được xem là điểm cân bằng giữa chi phí và hiệu năng.
Trước đó, Zhipu AI đã ra mắt GLM-5.3 như một mô hình ngôn ngữ lớn mới với hiệu năng lập trình được tăng cường. Công ty cho biết sẽ cung cấp mô hình này trước tiên qua GLM Coding Plan và ZCode, còn API và trọng số công khai (open weights) sẽ được phát hành theo từng giai đoạn sau khi hoàn tất đánh giá an toàn.
Trọng số công khai là hình thức cho phép nhà phát triển bên ngoài tải trực tiếp cấu trúc mô hình và các giá trị đã huấn luyện để sử dụng. Với nhà phát triển, cách này mở rộng phạm vi ứng dụng hơn so với việc chỉ dùng API dạng đóng, nhưng đi kèm với đó là yêu cầu kiểm chứng an toàn và giới hạn phạm vi triển khai.
Tài liệu phát triển của Zhipu AI cũng xác định tác vụ tác nhân (agent) dài hạn, học tăng cường bất đồng bộ và hiệu quả xử lý ngữ cảnh dài là những trục chính trong dòng mô hình GLM-5. Tác vụ tác nhân dài hạn ở đây được hiểu là chuỗi công việc gồm nhiều bước lập kế hoạch, thực thi và kiểm chứng, thay vì chỉ đưa ra một câu trả lời đơn lẻ.
Xu hướng này cũng có liên quan gián tiếp đến các nhà phát triển blockchain, bởi công cụ kiểm toán hợp đồng thông minh, rà soát mã nguồn, phát hiện lỗ hổng và tự động hóa phát triển đều chịu ảnh hưởng từ hiệu năng và cơ chế an toàn của các mô hình AI lập trình. Tuy vậy, tài liệu công khai hiện chưa cho thấy liên kết trực tiếp nào giữa GLM-5.3 với một dự án tiền mã hóa hay blockchain cụ thể.
Đánh giá hiệu năng GLM-5.3 hiện vẫn chủ yếu dựa trên tài liệu do công ty công bố và các bài đưa tin bên ngoài. Mức độ ổn định trong triển khai thực tế, hiệu quả chi phí và mức kiểm soát bảo mật sẽ có cơ sở so sánh rõ hơn sau khi API và trọng số được công khai cùng các đánh giá độc lập.
Bình luận: bài viết của Tang Jie xem quy mô tham số, dữ liệu tiền huấn luyện, khối lượng tính toán lan truyền thuận và hậu huấn luyện đều là những biến số có thể điều chỉnh trong bài toán mở rộng mô hình. Trường hợp GLM-5.3 cho thấy cuộc đua mô hình AI lớn không còn được giải thích đơn thuần bằng việc xây dựng mô hình nền tảng ngày càng lớn hơn.
Bình luận 0