Điểm nghẽn trong hạ tầng tính toán AI đang chuyển từ cuộc cạnh tranh hiệu năng bán dẫn sang đóng gói tiên tiến, kết nối hệ thống và quản lý bộ nhớ.
BlockBeats đưa tin ngày 22 rằng ông Mr. Bubble, nhà thiết kế chip cấp cao kiêm chuyên gia phân tích phần cứng, đã nêu nhận định này trong cuộc phỏng vấn với Frictionless Podcast.
Nguyên nhân là chi phí sản xuất ở các tiến trình tiên tiến tăng, trong khi mức cải thiện mật độ tích hợp transistor chậm lại. Việc chỉ dựa vào thu nhỏ tiến trình để nâng hiệu năng ngày càng chịu áp lực về hiệu quả kinh tế.
Do đó, ngành công nghiệp đang chú trọng hơn đến đóng gói tiên tiến, công nghệ kết nối nhiều chip thành một hệ thống tính toán duy nhất để hỗ trợ xử lý và di chuyển dữ liệu.
Ông Mr. Bubble nhận định đơn vị cơ bản của tính toán AI trong tương lai có thể không còn là một chip hoặc máy chủ đơn lẻ mà là cả một rack, thậm chí nhiều rack. Rack là một đơn vị gồm máy chủ, thiết bị mạng cùng hệ thống điện và làm mát.
Khi đó, bảng mạch in (PCB), công nghệ đóng gói và kết nối giữa các chip có thể trở thành yếu tố giới hạn hiệu năng toàn hệ thống. Dù năng lực tính toán của chip tăng, tốc độ di chuyển dữ liệu giữa các linh kiện thấp vẫn có thể hạn chế thông lượng xử lý.
Cấu trúc bộ nhớ cũng có thể thay đổi. Khi cửa sổ ngữ cảnh trong quá trình suy luận AI dài hơn, việc lưu trữ toàn bộ thông tin quá khứ trong bộ nhớ băng thông cao (HBM) với chi phí cao sẽ khó khăn.
Ông Mr. Bubble đề xuất lưu dữ liệu được sử dụng thường xuyên trong HBM, còn ngữ cảnh ít được sử dụng hơn sẽ được chuyển sang bộ nhớ flash có dung lượng lớn hơn và chi phí thấp hơn. Đây là cách tiếp cận phân chia bộ nhớ thành nhiều tầng theo tần suất sử dụng và chi phí, thay vì xử lý toàn bộ như một không gian duy nhất.
Phân tầng bộ nhớ cho thấy quá trình suy luận AI cần đồng thời quản lý vị trí và đường di chuyển của dữ liệu. Thay vì đơn giản mở rộng dung lượng bộ nhớ tốc độ cao, dữ liệu được phân bổ vào các vị trí lưu trữ phù hợp với đặc tính của chúng.
DRAM 3D cũng được đề cập như một hướng đi của công nghệ bộ nhớ thế hệ tiếp theo. Tuy nhiên, thời điểm và hình thức công nghệ này được áp dụng trong sản phẩm thương mại chưa được xác nhận dựa trên các nội dung đã nêu.
Cấu trúc của quá trình huấn luyện và suy luận cũng được xem là một biến số trong thiết kế hệ thống AI. Nếu xử lý đầu vào ban đầu và giải mã dần chuyển sang mô hình tách biệt, năng lực thiết kế và kết nối toàn hệ thống có thể trở nên quan trọng không kém hiệu năng của từng chip.
Xử lý đầu vào ban đầu là giai đoạn mô hình đọc trước ngữ cảnh đầu vào và thực hiện tính toán, còn giải mã là giai đoạn tạo phản hồi tuần tự dựa trên kết quả đó. Việc tách hai quá trình cho phép thiết kế riêng cấu hình tính toán, bộ nhớ và mạng phù hợp với từng giai đoạn.
Trong cuộc phỏng vấn với Frictionless Podcast ngày 22, ông Mr. Bubble cho rằng các doanh nghiệp sở hữu năng lực về phần cứng, đóng gói, bộ nhớ và hạ tầng liên quan có thể đảm nhận vai trò dài hạn trong ngành AI nhiều hơn các công ty mô hình ngôn ngữ lớn. Tuy nhiên, doanh nghiệp hoặc công nghệ cụ thể nào sẽ dẫn dắt quá trình thương mại hóa và mở rộng nhu cầu vẫn cần được xác nhận riêng.
Phân tích này cho thấy trọng tâm cạnh tranh tính toán AI đang mở rộng từ GPU và các công ty phát triển mô hình sang công nghệ kết nối nhiều linh kiện và nhiều tầng bộ nhớ thành một hệ thống. Thiết kế hệ thống đồng thời quản lý đóng gói, độ trễ kết nối và dung lượng bộ nhớ được xem là một trong những nhiệm vụ chính của hạ tầng AI.
Bình luận 0