Qualcomm(QCOM) vừa hợp tác với công ty trí tuệ nhân tạo (AI) Tây Ban Nha Multiverse Computing để làm nhẹ các mô hình AI dùng cho trung tâm dữ liệu. Mục tiêu là giảm kích thước và gánh nặng vận hành của mô hình ngôn ngữ lớn (LLM), qua đó nâng hiệu quả suy luận (inference).
Multiverse Computing thông báo trên trang chủ ngày 5 rằng công ty sẽ tối ưu các mô hình AI đã được rút gọn để chạy chuyên biệt trên bộ tăng tốc Dragonfly AI200 và AI250 của Qualcomm. Công ty mô tả đây là “hợp tác nhằm đưa các mô hình AI hiệu quả vào trung tâm dữ liệu”.
Trọng tâm của hợp tác là CompactifAI, công nghệ nén mô hình do Multiverse Computing phát triển. Công nghệ này dùng mạng tensor, một cách tiếp cận toán học vốn được ứng dụng trong điện toán lượng tử, để giảm kích thước và lượng bộ nhớ mà LLM cần sử dụng.
Multiverse Computing đặt mục tiêu mô hình được nén bằng CompactifAI sẽ giảm 50-80% chi phí suy luận và tăng tốc độ suy luận tối đa gấp 2 lần, trong khi độ chính xác được giữ gần như tương đương mô hình gốc.
Đây là các con số mục tiêu mà Multiverse Computing tự đưa ra cho dịch vụ của mình. Việc mô hình có đạt hiệu quả tương tự trong môi trường vận hành thực tế hay không vẫn cần được kiểm chứng qua các trường hợp triển khai cho khách hàng và các bài đo hiệu năng độc lập trong thời gian tới.
Hợp tác này gắn với chiến lược của Qualcomm nhằm mở rộng sang thị trường trung tâm dữ liệu phục vụ suy luận AI. Hồi tháng 6, Qualcomm đã công bố dòng sản phẩm Dragonfly cùng lộ trình bộ tăng tốc suy luận gồm AI200, AI250 và AI300.
AI250 được thiết kế dựa trên nền tảng HBC Gen 1, cung cấp băng thông bộ nhớ hiệu dụng 133TB/s trên mỗi card. Theo Qualcomm, con số này cao gấp 18 lần so với AI200.
Cuộc đua hạ tầng AI đang mở rộng từ hiệu năng huấn luyện mô hình sang hiệu quả suy luận. Các dịch vụ gọi lệnh liên tục như chatbot, tác tử AI (AI agent), công cụ hỗ trợ tìm kiếm hay công cụ lập trình đều khiến chi phí suy luận tích lũy dần theo mỗi lần phản hồi.
Nén mô hình là một cách để giảm bộ nhớ, điện năng và độ trễ phản hồi cần thiết trong quá trình này. Trong khi Qualcomm cải thiện phần cứng và băng thông bộ nhớ, Multiverse Computing nhắm vào cùng một điểm nghẽn bằng cách giảm kích thước và gánh nặng vận hành của mô hình.
TokenPost trước đó cũng từng đưa tin rằng gánh nặng của hạ tầng AI đang lan từ hiệu năng tính toán sang dung lượng bộ nhớ, băng thông và cấu trúc di chuyển dữ liệu.
Vào tháng 6/2025, Multiverse Computing từng công bố CompactifAI có thể giảm kích thước LLM tới 95% mà vẫn giữ được hiệu năng. Cùng thời điểm, công ty cũng thông báo huy động được khoản đầu tư 189 triệu euro.
Công ty cho biết các mô hình đã nén có thể vận hành không chỉ trên đám mây và trung tâm dữ liệu riêng, mà còn trên một số môi trường siêu nhẹ như PC, điện thoại, phương tiện di chuyển và drone. Hợp tác lần này là bước mở rộng phạm vi ứng dụng công nghệ này sang bộ tăng tốc trung tâm dữ liệu của Qualcomm.
Tuy nhiên, thông báo lần này chưa cho thấy mối liên hệ trực tiếp nào với việc phát hành token, hạ tầng blockchain, thiết bị đào coin hay xử lý dữ liệu on-chain. Tác động của việc cải thiện hiệu suất điện năng và giảm chi phí suy luận tại trung tâm dữ liệu AI đối với AI phi tập trung, tính toán AI có thể kiểm chứng, hay ví AI on-device cũng chưa được làm rõ.
Qualcomm và Multiverse Computing dự kiến sẽ tối ưu các mô hình dựa trên CompactifAI cho Dragonfly AI200 và AI250. Mức giảm chi phí thực tế và khả năng duy trì hiệu năng sẽ chỉ có thể đánh giá cụ thể sau khi các trường hợp triển khai cho khách hàng và kết quả đo hiệu năng độc lập được công bố.
Bình luận 0