Back to top
  • 공유 Chia sẻ
  • 인쇄 In
  • 글자크기 Cỡ chữ
URL đã được sao chép

NVIDIA sản xuất hàng loạt rack Groq 3 LPX, tăng tốc suy luận AI

Thiết bị rack AI được đặt trong hành lang trung tâm dữ liệu / TokenPost.ai

NVIDIA (NVIDIA) đã chính thức bước vào giai đoạn sản xuất hàng loạt hệ thống rack Groq 3 LPX (Groq 3 LPX), bộ tăng tốc suy luận AI có độ trễ thấp. Nebius (Nebius) là đơn vị đầu tiên triển khai công nghệ này, dự kiến cung cấp cho các nhà phát triển tại trung tâm dữ liệu của mình vào cuối năm nay.

Theo NVIDIA đưa tin trên blog chính thức ngày 24 (giờ địa phương), Groq 3 LPX là hệ thống cấp rack giúp mở rộng hiệu năng suy luận của nền tảng Vera Rubin (Vera Rubin). Công ty cho biết trong bài kiểm tra hiệu năng với mô hình Gemma 4 31B (Gemma 4 31B), hệ thống này xử lý được 3.400 token đầu ra mỗi giây đối với các tác vụ ngữ cảnh dài lên tới 100.000 token.

Groq 3 LPX có cấu trúc kết nối 256 bộ tăng tốc LPU trên mỗi rack. Trong bài viết kỹ thuật hồi tháng 3, NVIDIA từng giới thiệu hệ thống này sở hữu tổng cộng 128GB bộ nhớ SRAM tích hợp trên chip, cùng hiệu năng suy luận FP8 đạt mức 315 petaflop (PFLOPS).

NVIDIA cho biết Groq 3 LPX được sử dụng cùng với Vera Rubin NVL72, tập trung vào việc tăng tốc độ tạo token cho các dịch vụ AI nhạy cảm với độ trễ phản hồi, như trợ lý hội thoại và hệ thống lập trình tự động.

Bình luận: việc Nebius trở thành đối tác triển khai đầu tiên phần nào cho thấy sức hút của các giải pháp suy luận AI tốc độ cao trong ngành hạ tầng đám mây, khi nhiều nhà cung cấp đang tìm cách rút ngắn độ trễ phản hồi cho các dịch vụ AI tạo sinh.

<Bản quyền ⓒ TokenPost, nghiêm cấm sao chép và phân phối trái phép>

Phổ biến nhất

Các bài viết liên quan khác

Bình luận 0

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.

0/1000

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.
1