Zhipu GLM cho biết ngày 17 rằng họ đã xây dựng hệ thống suy luận GLM-5.3-Flash trên một cụm gồm hơn 100.000 chip AI do Trung Quốc sản xuất, đồng thời nâng thông lượng đầu-cuối lên gấp 3 lần so với mức cơ sở ban đầu trong chưa đầy 2 tuần.
Zhipu GLM cho biết tác nhân hạ tầng dựa trên GLM-5.3 đã thực hiện thiết kế, điều phối và tối ưu hóa hạ tầng suy luận. Trong quá trình này, hiệu suất sử dụng phần cứng và chi phí trên mỗi token đã đạt mức tương đương với GPU của Nvidia.
Zhipu GLM giới thiệu trường hợp này như một ví dụ kỹ thuật về phương pháp cải thiện tự đệ quy (RSI), trong đó mô hình cải thiện ngược lại hệ thống đang vận hành chính nó.
Bình luận 0