Back to top
  • 공유 Chia sẻ
  • 인쇄 In
  • 글자크기 Cỡ chữ
URL đã được sao chép

DDN tích hợp Infinia vào hệ thống suy luận của Nvidia(NVDA), giảm nghẽn dữ liệu GPU

Hình ảnh liên quan đến Nvidia / TokenPost.ai

DDN đã tích hợp nền tảng lưu trữ Infinia vào hệ thống truyền dữ liệu suy luận của Nvidia(NVDA). Mục tiêu chính của hợp tác này là rút ngắn thời gian GPU phải chờ dữ liệu khi vận hành các mô hình ngôn ngữ lớn (LLM).

DDN cho biết trên blog kỹ thuật của công ty ngày 23/7 rằng plugin NIXL của Infinia đã được đưa vào bản phân phối NIXL 1.3 của Nvidia và container suy luận Dynamo. NIXL là viết tắt của NVIDIA Inference Transfer Library, thư viện xử lý việc di chuyển dữ liệu giữa GPU, CPU, SSD và bộ nhớ lưu trữ đối tượng trong môi trường suy luận phân tán.

Việc tích hợp lần này tập trung vào quá trình di chuyển “KV cache” phát sinh khi AI thực hiện suy luận. KV cache là dữ liệu trung gian mà LLM lưu lại để tái sử dụng ngữ cảnh trước đó. Khi cuộc hội thoại kéo dài hoặc nhiều yêu cầu dồn về cùng lúc, KV cache nhanh chóng chiếm dụng bộ nhớ GPU. Theo tài liệu của Nvidia Dynamo, việc chuyển KV cache sang bộ nhớ CPU, SSD hoặc hệ thống lưu trữ kết nối mạng có thể giảm việc tính toán lại và rút ngắn độ trễ phản hồi.

Trước đây, người dùng phải tự tìm plugin lưu trữ riêng, kiểm tra khả năng tương thích với phiên bản NIXL đang cài đặt rồi duy trì cấu hình cho từng môi trường. Từ NIXL 1.3, plugin Infinia đã nằm sẵn trong gói tiêu chuẩn, nên chỉ cần cài NIXL hoặc dùng container Dynamo rồi bổ sung gói client của DDN là đủ. DDN cho biết tính năng tăng tốc KV cache có thể được bật chỉ bằng cấu hình, không cần chỉnh sửa mã ứng dụng.

Sven Oehme (Sven Oehme), Giám đốc công nghệ (CTO) của DDN, chia sẻ trên blog kỹ thuật rằng “DDN Infinia giờ đây cung cấp dữ liệu ngữ cảnh trực tiếp cho GPU”. Theo ông, điều này giúp GPU dành nhiều tài nguyên tính toán hơn cho việc tạo token thay vì chờ dữ liệu. Tuy nhiên mức tiết kiệm chi phí thực tế còn tùy thuộc vào môi trường và khối lượng công việc của từng khách hàng.

Kho lưu trữ ai-dynamo/nixl trên GitHub giới thiệu NIXL là thư viện giúp tăng tốc giao tiếp điểm-điểm giữa các framework suy luận AI như Nvidia Dynamo. Thư viện này trừu tượng hóa bộ nhớ CPU, GPU cùng các lớp lưu trữ file, block và object theo cấu trúc plugin, qua đó xử lý việc di chuyển dữ liệu giữa nhiều tầng lưu trữ khác nhau.

Hợp tác lần này nối tiếp xu hướng xử lý nghẽn lưu trữ và truyền dữ liệu tại các trung tâm dữ liệu AI mà TokenPost từng đề cập trước đó. Nếu Micron và Microchip tập trung nâng hiệu năng xử lý của thiết bị lưu trữ và cấu trúc kết nối, thì DDN và Nvidia lại cải thiện đường di chuyển dữ liệu ngữ cảnh đã lưu trữ tới GPU trong quá trình suy luận.

Thông báo lần này chưa cho thấy liên hệ trực tiếp nào với tiền mã hóa hay blockchain. Với các doanh nghiệp hạ tầng crypto có sử dụng năng lực tính toán AI, hiệu suất sử dụng GPU và chi phí trung tâm dữ liệu có thể là yếu tố vận hành gián tiếp, nhưng tác động cụ thể chưa được đưa ra.

<Bản quyền ⓒ TokenPost, nghiêm cấm sao chép và phân phối trái phép>

Phổ biến nhất

Các bài viết liên quan khác

Bình luận 0

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.

0/1000

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.
1