Back to top
  • 공유 Chia sẻ
  • 인쇄 In
  • 글자크기 Cỡ chữ
URL đã được sao chép

Prime Intellect công bố dịch vụ suy luận, xử lý gần 1 nghìn tỷ token mỗi ngày

Bộ tăng tốc GPU đảm nhiệm tính toán suy luận và các dây cáp kết nối / TokenPost.ai

Prime Intellect cho biết hệ thống suy luận nội bộ của công ty đã xử lý gần 1 nghìn tỷ token mỗi ngày. Công ty mở dịch vụ này cho người dùng bên ngoài và triển khai GLM-5.3 làm mô hình đầu tiên.

Prime Inference được dùng cho học tăng cường, tạo dữ liệu tổng hợp, đánh giá mô hình và các tác vụ của tác nhân lập trình, theo BlockBeats. Người dùng có thể gọi suy luận của mô hình khi cần hoặc đặt trước dung lượng để sử dụng ổn định trong thời gian dài. API tương thích với OpenAI API.

Prime Intellect đã bổ sung dịch vụ suy luận vào hạ tầng hiện có dành cho học tăng cường, đánh giá và huấn luyện trong môi trường sandbox. Nhờ đó, công ty có thể xử lý việc huấn luyện mô hình và triển khai thực tế trên cùng một nền tảng, đồng thời dùng dữ liệu phát sinh trong quá trình vận hành dịch vụ cho các đợt huấn luyện tiếp theo. BlockBeats đưa tin công ty cũng đã vận hành các đợt triển khai quy mô lớn cho khách hàng từ tháng 1 năm nay.

Để phục vụ đầu vào dài và các tác vụ của tác nhân, công ty phân chia việc xử lý đầu vào và tạo câu trả lời cho các nhóm GPU riêng. Trong thử nghiệm nội bộ, độ trễ giữa các token ở mức p90 giảm khoảng 40% so với trước. p90 là chỉ số cho biết 90% giá trị đo được bằng hoặc thấp hơn mức này.

Prime Intellect cho biết việc nén bộ nhớ đệm KV giúp số token mà một bộ giải mã có thể lưu trong cùng dung lượng bộ nhớ tăng từ 1,09 triệu lên 1,63 triệu, tương đương khoảng 50%. Các số liệu về độ trễ và dung lượng bộ nhớ đệm là kết quả thử nghiệm nội bộ của công ty.

<Bản quyền ⓒ TokenPost, nghiêm cấm sao chép và phân phối trái phép>

Phổ biến nhất

Các bài viết liên quan khác

Bình luận 0

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.

0/1000

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.
1