Microsoft (MSFT) cho biết ngày 26/1 rằng chip tăng tốc suy luận AI tự phát triển Maia 200 đã cải thiện hiệu suất tính trên mỗi USD tới 30% so với hệ thống hiện tại của chính hãng. Đây được xem là chiến lược tối ưu chi phí cho các tác vụ suy luận cụ thể, hơn là thay thế hoàn toàn Nvidia (NVDA).
Cùng ngày, Microsoft chính thức công bố Maia 200 và mô tả đây là chip tăng tốc chuyên dụng nhằm cải thiện tính kinh tế của suy luận AI quy mô lớn. Đối tượng so sánh trong tài liệu chính thức của hãng không phải là sản phẩm của Nvidia mà là hệ thống nội bộ trước đó của Microsoft.
Maia 200 được thiết kế cho giai đoạn suy luận, tức khi mô hình AI đã huấn luyện xong trả lời các yêu cầu của người dùng, thay vì cho quá trình huấn luyện tạo mô hình mới. Với các dịch vụ AI tạo sinh, mỗi yêu cầu gửi đến đều kéo theo một lượt tính toán suy luận, nên thông lượng xử lý và hiệu quả sử dụng điện năng ảnh hưởng trực tiếp đến chi phí vận hành.
Microsoft cho biết Maia 200 giúp tăng hiệu suất trên mỗi USD thêm 30% so với hệ thống cũ. Con số giảm 30-40% chi phí vận hành so với chip Nvidia không được xác nhận trực tiếp trong tài liệu chính thức của Microsoft.
Trong buổi công bố kết quả kinh doanh quý 2 ngày 28/1, Microsoft cho biết tổng chi phí sở hữu (TCO) của Maia 200 đã cải thiện hơn 30% so với phần cứng mới nhất trước đó của chính hãng. TCO là tổng chi phí bao gồm giá mua thiết bị, chi phí điện năng và chi phí bảo trì, vận hành.
Tại buổi công bố kết quả kinh doanh quý 3 ngày 29/4, Microsoft cho biết Maia 200 đang được vận hành tại các trung tâm dữ liệu ở Iowa và Arizona. Hãng cũng cho biết hiệu suất xử lý token tính trên mỗi USD, so với silicon mới nhất của chính mình, cũng đã cải thiện hơn 30%.
Microsoft chủ trương vận hành song song chip Nvidia, AMD và Maia tự phát triển để cân bằng giữa hiệu năng, chi phí và nguồn cung. Đây là chiến lược kết hợp, bố trí chip phù hợp theo từng loại tác vụ, thay vì thay thế toàn bộ chip đồ họa đa dụng (GPU).
Chip chuyên dụng cho suy luận có ưu điểm là tối ưu phần cứng theo các dạng phép tính lặp lại. Ngược lại, phạm vi ứng dụng hẹp hơn GPU đa dụng và việc chuyển đổi phần mềm hiện có có thể phát sinh thêm chi phí.
Maia 200 được sản xuất trên tiến trình 3 nanomet của TSMC và áp dụng cấu trúc mở rộng dựa trên Ethernet. Microsoft cho biết có thể mở rộng cụm chip lên tới 6.144 bộ tăng tốc.
Cùng với Maia 200, Microsoft cũng công bố các công cụ phần mềm như Triton. Reuters đưa tin các công cụ này nhắm vào hệ sinh thái nhà phát triển CUDA, vốn là năng lực cạnh tranh cốt lõi của Nvidia.
Sức cạnh tranh của chip tăng tốc AI không chỉ phụ thuộc vào hiệu năng bán dẫn. Công cụ phát triển, thư viện phần mềm và khả năng tương thích với các mô hình hiện có phải được đảm bảo thì khách hàng mới có thể chuyển tác vụ sang chip mới.
Đánh giá trong ngành hiện còn trái chiều. Các nhà phân tích được TechTarget trích dẫn cho rằng Maia 200 có thể phù hợp với các tác vụ suy luận dạng chatbot quy mô lớn như Copilot, nhưng khó có thể thay thế Nvidia trong ngắn hạn do vấn đề tương thích phần mềm và chi phí chuyển đổi.
Một số nhà phân tích nhận định vị thế thống lĩnh của Nvidia có thể bị pha loãng về dài hạn. Trong khi đó, một số khác tỏ ra hoài nghi về khả năng Maia làm lung lay đáng kể vị thế của Nvidia trong 3-4 năm tới.
Việc Microsoft mở rộng chip tự phát triển là bước đi nhằm điều chỉnh chi phí và chuỗi cung ứng, bằng cách kết hợp song song sản phẩm từ các nhà cung cấp bán dẫn bên ngoài với chip tự thiết kế nội bộ. Do các số liệu chính thức được đưa ra dựa trên hạ tầng nội bộ của Microsoft, nên còn quá sớm để suy diễn trực tiếp sang chi phí sử dụng thực tế của khách hàng bên ngoài.
Gần đây, sự chú ý đang chuyển sang thế hệ chip kế tiếp Maia 300. Barron's đưa tin Microsoft đang thúc đẩy mở rộng sản xuất chip AI tự phát triển và có thể công bố Maia 300 sớm nhất vào tháng 9. TokenPost trước đó cũng đã đưa tin về kế hoạch tăng sản lượng chip AI tự phát triển của Microsoft và khả năng công bố Maia 300.
Bình luận 0