Back to top
  • 공유 Chia sẻ
  • 인쇄 In
  • 글자크기 Cỡ chữ
URL đã được sao chép

Kimi đạt tốc độ suy luận nhanh gần 3 lần nhờ AI viết lại kernel attention

Kiểm tra bo mạch tăng tốc GPU hiệu năng cao / TokenPost.ai

Kernel attention của Kimi được AI viết lại để tối ưu cho GPU Nvidia, ghi nhận tốc độ suy luận nhanh gần 3 lần so với phiên bản chính thức, theo một báo cáo.

BlockBeats đưa tin AI đã tối ưu kernel GPU được sử dụng cho phép tính attention của Kimi, trong đó phiên bản viết lại đạt tốc độ nhanh gần 3 lần so với bản chính thức. Kernel là đoạn mã cấp thấp giúp chạy phép tính attention của các mô hình trí tuệ nhân tạo trên GPU.

Moonshot AI đã công khai FlashKDA dành cho Kimi Delta Attention, được xây dựng trên nền tảng CUTLASS của Nvidia. vLLM cũng cho biết đã áp dụng kernel CUDA hợp nhất cùng kernel được phát triển trong hợp tác với Nvidia cho Kimi K3.

<Bản quyền ⓒ TokenPost, nghiêm cấm sao chép và phân phối trái phép>

Phổ biến nhất

Các bài viết liên quan khác

Bình luận 0

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.

0/1000

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.
1