Kernel attention của Kimi được AI viết lại để tối ưu cho GPU Nvidia, ghi nhận tốc độ suy luận nhanh gần 3 lần so với phiên bản chính thức, theo một báo cáo.
BlockBeats đưa tin AI đã tối ưu kernel GPU được sử dụng cho phép tính attention của Kimi, trong đó phiên bản viết lại đạt tốc độ nhanh gần 3 lần so với bản chính thức. Kernel là đoạn mã cấp thấp giúp chạy phép tính attention của các mô hình trí tuệ nhân tạo trên GPU.
Moonshot AI đã công khai FlashKDA dành cho Kimi Delta Attention, được xây dựng trên nền tảng CUTLASS của Nvidia. vLLM cũng cho biết đã áp dụng kernel CUDA hợp nhất cùng kernel được phát triển trong hợp tác với Nvidia cho Kimi K3.
Bình luận 0