Back to top
  • 공유 Chia sẻ
  • 인쇄 In
  • 글자크기 Cỡ chữ
URL đã được sao chép

Ox Alpha lộ diện là GLM-5.3-Flash, chạy trên chip AI Trung Quốc

Bo mạch chip AI được lắp trên thiết bị thử nghiệm / TokenPost.ai

Công ty trí tuệ nhân tạo (AI) Trung Quốc Z.ai (Zhipu AI) đã xác nhận mô hình AI ẩn danh Ox Alpha chính là GLM-5.3-Flash. Mô hình có tổng cộng 320 tỷ tham số được vận hành trên chip AI sản xuất trong nước, khiến chiến lược giảm phụ thuộc vào GPU hiệu năng cao của Mỹ trong chuỗi cung ứng AI Trung Quốc cũng được đặt lên bàn cân kiểm chứng.

Z.ai công bố GLM-5.3-Flash trên blog công ty ngày 26/8, đồng thời cho biết trước khi ra mắt chính thức, mô hình này đã được thử nghiệm ẩn danh dưới tên “ox-alpha” trên nền tảng OpenCode và OpenRouter. Công ty cho biết toàn bộ lưu lượng thử nghiệm được xử lý trên chip AI sản xuất tại Trung Quốc.

GLM-5.3-Flash là mô hình đa phương thức (multimodal) gốc đầu tiên trong dòng GLM-5, có khả năng xử lý đầu vào văn bản, hình ảnh và video. Mô hình có tổng cộng 320 tỷ tham số, trong đó số tham số hoạt động là 18 tỷ.

Theo Z.ai, mô hình mới vượt trội hơn GLM-5.2 ở các bài kiểm tra hiệu năng liên quan đến lập trình, sử dụng công cụ (tool use), tự động hóa và tác vụ công việc. Công ty công bố điểm số gồm 84,3 trên Terminal-Bench 2.1, 63,4 trên DeepSWE v1.1 và 48,8 trên AutomationBench v1.0.6.

Trọng số mô hình đã được công khai trên Hugging Face dưới tên “zai-org/GLM-5.3-Flash”, cấp phép theo giấy phép MIT. Trang mô hình trên Hugging Face phân loại đây là mô hình hỗ trợ tạo văn bản và nhận đầu vào dạng ảnh kết hợp văn bản.

Việc công bố lần này là bước xác nhận tiếp theo cho thông tin trước đó về việc Ox Alpha xuất hiện ẩn danh trên OpenRouter với khả năng xử lý ngữ cảnh lên tới 1 triệu token. OpenRouter là nền tảng định tuyến mô hình, kết nối quyền truy cập tới nhiều mô hình AI khác nhau. Trước khi công bố, Ox Alpha xuất hiện mà không tiết lộ tên nhà phát triển, trở thành đối tượng được cộng đồng lập trình viên theo dõi sát về hiệu năng lập trình và các tác vụ AI agent kéo dài.

Thông tin về giá khó gói gọn trong một con số duy nhất. Trang nhà cung cấp Z.ai trên OpenRouter niêm yết giá GLM-5.3-Flash ở mức 0,15 USD cho mỗi triệu token đầu vào và 0,50 USD cho mỗi triệu token đầu ra. Trong khi đó, trang mô hình và màn hình so sánh giá lại hiển thị mức chiết khấu 50%, với giá 0,075 USD cho đầu vào và 0,25 USD cho đầu ra.

Quy mô chip cũng có sự chênh lệch giữa thông báo chính thức và truyền thông quốc tế. Blog tiếng Anh của Z.ai chỉ ghi “hàng chục nghìn chip tăng tốc phát triển trong nước”. Trong khi đó, tờ South China Morning Post (SCMP) đưa tin Zhipu AI đã vận hành mô hình trên cụm 100.000 chip sản xuất tại Trung Quốc. Tên nhà cung cấp chip không được tiết lộ.

Số liệu về mức sử dụng cũng khác nhau tùy nguồn. SCMP dẫn thông báo của Zhipu cho biết tổng cộng 62 nghìn tỷ token đã được xử lý trên OpenRouter và OpenCode trước khi ra mắt chính thức, trong đó riêng 3 ngày đầu trên OpenRouter đã vượt 11 nghìn tỷ token. Một số nguồn tin khác lại đưa ra các con số như 17,5 nghìn tỷ token, hay mức xử lý 100 nghìn tỷ token mỗi ngày.

Thị trường Hong Kong phản ứng ngay sau thông báo. Theo dữ liệu của ET Net, cổ phiếu Z.ai (02513) đạt 1.160 đô la Hong Kong trong phiên giao dịch ngày 27/8, tăng 12,621% so với phiên trước đó. Một bài viết thị trường qua Yahoo Finance cũng cho biết cổ phiếu này tăng hơn 12%.

Diễn biến này cùng nằm trong mạch với bài viết trước đó của TokenPost về việc cổ phiếu Z.ai tăng hơn 8% trên sàn Hong Kong sau khi công bố mô hình AI dựa trên chip Trung Quốc. Ở thời điểm đó, các thông tin về việc ra mắt GLM-5.3-Flash, công khai trọng số trên Hugging Face và dịch vụ ẩn danh Ox Alpha đã được xác nhận.

Phản ứng từ cộng đồng lập trình viên khá trái chiều. Trên Hacker News, sau khi Ox Alpha được xác nhận chính là GLM-5.3-Flash, nhiều ý kiến đánh giá tích cực về hiệu năng lập trình, nhưng cũng không ít phàn nàn về tình trạng lặp vòng lệnh, tốc độ phản hồi chậm và khả năng tự chủ (autonomy) chưa hoàn thiện. Business Insider cho biết hashtag liên quan trên Weibo đã vượt 13 triệu lượt xem.

Điểm đáng chú ý với cộng đồng phát triển và ngành hạ tầng AI không nằm ở hiệu năng mô hình, mà ở cấu trúc triển khai. Thông qua nền tảng định tuyến như OpenRouter, lập trình viên có thể so sánh giá, độ dài ngữ cảnh, định dạng đầu vào và chất lượng phản hồi để tích hợp dịch vụ mà không cần ký hợp đồng trực tiếp với nhà cung cấp mô hình. Cách làm để mô hình xem trước ẩn danh thu thập dữ liệu sử dụng thực tế trước, rồi mới công bố nhà phát triển và trọng số, cũng trở nên khả thi nhờ cấu trúc này.

Tuy vậy, hiệu năng và hiệu quả phần cứng hiện vẫn phụ thuộc lớn vào thông báo của công ty và phản hồi ban đầu từ người dùng. Việc các bài kiểm tra hiệu năng do công ty công bố, cũng như hiệu năng suy luận quy mô lớn trên chip Trung Quốc, có tái hiện được ở mức tương đương trong môi trường bên ngoài hay không vẫn cần được kiểm chứng độc lập.

Với thông báo từ Z.ai, tranh cãi về danh tính Ox Alpha tạm thời được khép lại. Những vấn đề còn để ngỏ là cấu trúc chi phí với giá tiêu chuẩn và giá chiết khấu cùng tồn tại, số liệu sử dụng token khác nhau tùy nguồn, và quy mô chip Trung Quốc còn chênh lệch giữa thông báo chính thức và các bài báo.

<Bản quyền ⓒ TokenPost, nghiêm cấm sao chép và phân phối trái phép>

Phổ biến nhất

Các bài viết liên quan khác

Bình luận 0

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.

0/1000

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.
1