Back to top
  • 공유 Chia sẻ
  • 인쇄 In
  • 글자크기 Cỡ chữ
URL đã được sao chép

Kimi K3 đạt 460 token/giây, lần lượt xuất hiện trên API của các công ty hạ tầng AI Mỹ

Cảnh di chuyển thiết bị điện toán GPU phục vụ suy luận AI / TokenPost.ai

Mô hình mã nguồn mở lớn Kimi K3 do Moonshot AI của Trung Quốc phát triển đã lần lượt được đưa lên dịch vụ API của các công ty hạ tầng AI Mỹ. Modal công bố hiệu suất xử lý 460 token/giây khi áp dụng bộ tăng tốc suy luận chuyên dụng.

Kimi K3 là mô hình Mixture-of-Experts (MoE) với 2,8 nghìn tỷ tham số. Trong số 896 mô-đun chuyên gia, 16 mô-đun hoạt động trên mỗi token, với khoảng 104 tỷ tham số được kích hoạt. Cửa sổ ngữ cảnh đạt 1.048.576 token, hướng tới xử lý tài liệu dài và kho mã quy mô lớn.

Moonshot AI đã công khai trọng số mô hình Kimi K3 cùng báo cáo kỹ thuật. Đây được xem là bối cảnh cho thấy khoảng cách giữa phát triển mô hình và vận hành dịch vụ thực tế.

Modal cho biết đã bắt đầu hỗ trợ Kimi K3 từ ngày 27 tháng 7 năm 2026 và đạt tốc độ xử lý 460 token/giây trong môi trường riêng. Kết quả này đến từ việc áp dụng DFlash, bộ tăng tốc suy luận được huấn luyện cho Kimi K3. DFlash tăng thông lượng bằng cách đề xuất trước các token mà mô hình có thể tạo ra, sau đó để mô hình chính xác thực chúng.

Mức 460 token/giây được ghi nhận trong cấu hình phần cứng và phần mềm cụ thể của Modal. Không thể khẳng định tốc độ này sẽ được tái hiện với cấu hình GPU hoặc môi trường công việc khác. Hiệu suất thực tế có thể thay đổi tùy độ dài yêu cầu và số lượng yêu cầu xử lý đồng thời.

Fireworks và Baseten cũng cung cấp Kimi K3 dưới dạng mô hình API. Mức giá được ba công ty công bố là 3 USD (khoảng 4.158 won) cho 1 triệu token đầu vào, 0,30 USD (khoảng 416 won) cho 1 triệu token đầu vào được lưu trong bộ nhớ đệm và 15 USD (khoảng 20.079 won) cho 1 triệu token đầu ra.

Cạnh tranh về giá giữa các dịch vụ API cho thấy việc công khai trọng số mô hình là chưa đủ. Khách hàng doanh nghiệp cần so sánh đồng thời đơn giá token, phí sử dụng GPU chuyên dụng, thời gian chờ, tỷ lệ truy cập bộ nhớ đệm, chi phí truyền dữ liệu, số yêu cầu đồng thời và phương thức xử lý theo lô.

Độ khó khi vận hành Kimi K3 thể hiện qua quy mô mô hình. Khi trực tiếp vận hành mô hình, dung lượng bộ nhớ GPU và băng thông kết nối giữa các GPU là những yếu tố quan trọng.

Trong khi đó, thông tin cho rằng cần 8 GPU GB300 để vận hành Kimi K3 chưa được xác nhận từ các tài liệu công khai. Vì vậy, không nên xem một số lượng GPU cụ thể là điều kiện bắt buộc để vận hành mô hình, mà cần phân biệt đó là một trường hợp phụ thuộc vào môi trường triển khai thực tế.

Nvidia($NVDA) mô tả GB300 NVL72 là hệ thống quy mô rack kết hợp 72 GPU Blackwell Ultra và 36 CPU Grace. MI355X của AMD hỗ trợ bộ nhớ HBM3E 288GB và băng thông bộ nhớ 8TB/s.

Thông số của hai sản phẩm cho thấy khi cung cấp dịch vụ cho các mô hình lớn, không chỉ năng lực tính toán của GPU mà cả dung lượng bộ nhớ và tốc độ di chuyển dữ liệu cũng đóng vai trò quan trọng. Mô hình càng lớn, quá trình đưa trọng số vào bộ nhớ và trao đổi dữ liệu giữa nhiều GPU càng ảnh hưởng đến chi phí dịch vụ và độ trễ.

Cục Công nghiệp và An ninh thuộc Bộ Thương mại Mỹ (BIS) cho biết các mạch tích hợp điện toán tiên tiến và thiết bị liên quan xuất khẩu sang các quốc gia D:5, trong đó có Trung Quốc, có thể chịu kiểm soát xuất khẩu. Tuy nhiên, các tài liệu công khai chưa xác nhận Moonshot AI không thể trực tiếp tiếp cận một GPU cụ thể do Mỹ sản xuất, cũng như việc các nhà cung cấp dịch vụ Mỹ đều sử dụng loại GPU đó.

Cộng đồng cũng đưa ra các trường hợp hiệu suất khác. Một người dùng Reddit tuyên bố đã chạy Kimi K3 bằng 8 GPU B300, đạt 92 token/giây với chi phí khoảng 190 USD (khoảng 263.340 won) cho 1 triệu token.

Đây là kết quả trong một bài đăng cá nhân nên không thể so sánh với mức 460 token/giây do Modal công bố trong cùng điều kiện. Điểm khác biệt về phần cứng, phần mềm, cấu hình yêu cầu và phương pháp tính chi phí khiến chuẩn đo riêng của nhà cung cấp dịch vụ và thử nghiệm cộng đồng không tương đương.

Trường hợp này cho thấy năng lực cạnh tranh của các mô hình AI lớn không chỉ phụ thuộc vào cấu trúc mô hình. Dù trọng số mô hình được công khai, giai đoạn cung cấp dịch vụ thực tế vẫn cần bộ nhớ GPU, kết nối mạng, phần mềm suy luận và chính sách xử lý dữ liệu. Ưu thế về chi phí và tốc độ chỉ có thể được đánh giá sau khi tiến hành kiểm chứng độc lập với cùng mô hình, phần cứng và khối lượng công việc.

<Bản quyền ⓒ TokenPost, nghiêm cấm sao chép và phân phối trái phép>

Phổ biến nhất

Các bài viết liên quan khác

Bình luận 0

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.

0/1000

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.
1