Back to top
  • 공유 Chia sẻ
  • 인쇄 In
  • 글자크기 Cỡ chữ
URL đã được sao chép

GLM-5.3-FlashX ra mắt, tốc độ suy luận tối đa 200 tokens/s

Dây chuyền sản xuất kiểm tra chip tăng tốc AI nội địa / TokenPost.ai

Zhipu AI (智谱) đã ra mắt GLM-5.3-FlashX với tốc độ suy luận tối đa 200 tokens/s dựa trên 100.000 chip nội địa, đồng thời bắt đầu vận hành API và trung tâm trải nghiệm.

Zhipu AI cho biết GLM-5.3-FlashX tăng tốc dựa trên năng lực tính toán suy luận do 100.000 chip nội địa cung cấp. Công ty cũng tiếp tục đầu tư vào hạ tầng và tối ưu hóa suy luận, PANews đưa tin.

Đợt ra mắt này không chỉ nhấn mạnh hiệu suất của mô hình mà còn giới thiệu hạ tầng suy luận cần thiết cho hoạt động dịch vụ thực tế. Suy luận là quá trình mô hình tạo phản hồi dựa trên đầu vào, trong đó tốc độ xử lý chịu ảnh hưởng của cấu trúc mô hình, cấu hình phần cứng và tối ưu hóa phần mềm.

Mô hình nền tảng của GLM-5.3-FlashX là GLM-5.3-Flash, được công bố ngày 26 tháng 8. Mô hình có tổng cộng 320 tỷ tham số, trong đó 18 tỷ tham số được kích hoạt trong mỗi lần suy luận, đồng thời hỗ trợ cửa sổ ngữ cảnh 1 triệu tokens. Các thông số và thời điểm công bố này cũng được ghi trong tài liệu mô hình.

Tổng số tham số phản ánh quy mô toàn bộ trọng số học được mà mô hình sở hữu. Tham số được kích hoạt là phần thực sự tham gia tính toán khi xử lý đầu vào, giúp giảm lượng phép tính cần thiết cho mỗi yêu cầu trong khi vẫn duy trì quy mô tổng thể.

Cửa sổ ngữ cảnh 1 triệu tokens cho biết phạm vi đầu vào và lịch sử hội thoại mà mô hình có thể xử lý trong một yêu cầu. Tuy nhiên, kích thước cửa sổ ngữ cảnh và tốc độ phản hồi thực tế là hai chỉ số khác nhau, nên không thể cho rằng tốc độ tối đa vẫn được duy trì khi xử lý đầu vào dài.

Zhipu AI đưa ra tốc độ suy luận tối đa của GLM-5.3-FlashX là 200 tokens/s. Đây là mức tối đa do công ty công bố, còn tốc độ trung bình mà người dùng trải nghiệm có thể thay đổi tùy loại yêu cầu và môi trường vận hành.

Trong lần công bố này, công ty không đưa ra tốc độ xử lý trung bình, nhà sản xuất chip, giá dịch vụ hay số liệu so sánh hiệu suất giữa các mô hình. Vì vậy, điều kiện về độ dài đầu vào và cấu hình phần cứng dùng để đo mức 200 tokens/s vẫn cần được xác nhận qua các tài liệu vận hành bổ sung.

Trước khi được công bố, GLM-5.3-Flash từng được thử nghiệm ẩn danh dưới tên 'Ox Alpha'. Sau khi tên mô hình chính thức được công bố, mô hình này được xác nhận thuộc dòng GLM-5 của Zhipu AI. Việc ra mắt FlashX tiếp tục đưa dòng mô hình này vào API và dịch vụ trải nghiệm.

API là phương thức kết nối cho phép dịch vụ bên ngoài hoặc nhà phát triển gọi các chức năng của mô hình. Trung tâm trải nghiệm cung cấp kênh để người dùng thử phản hồi của mô hình mà không cần xây dựng dịch vụ riêng. Việc bắt đầu vận hành cả hai tính năng cho thấy công ty muốn cung cấp môi trường sử dụng thực tế cùng với việc công bố mô hình.

Hiệu suất thực tế của GLM-5.3-FlashX có thể được so sánh qua các bài đánh giá chuẩn chi tiết và tài liệu vận hành API sẽ được công bố trong thời gian tới. Đáng chú ý là điều kiện đo tốc độ tối đa do công ty đưa ra và khả năng công bố đồng thời tốc độ xử lý trung bình.

<Bản quyền ⓒ TokenPost, nghiêm cấm sao chép và phân phối trái phép>

Phổ biến nhất

Các bài viết liên quan khác

Bình luận 0

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.

0/1000

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.
1