Giới quan sát hạ tầng trí tuệ nhân tạo (AI) một lần nữa cho rằng nút thắt cổ chai đang dịch chuyển từ năng lực tính toán của bộ xử lý đồ họa (GPU) sang nguồn cung bộ nhớ. Để duy trì tác vụ trong thời gian dài, các AI agent phải lưu trữ và gọi lại ngữ cảnh cùng lịch sử thao tác trước đó, khiến áp lực nhu cầu đối với bộ nhớ băng thông cao (HBM) và NAND ngày càng lớn.
Elon Musk, CEO SpaceX, đã trả lời bài đăng của Peter H. Diamandis, nhà sáng lập XPRIZE, trên X rằng “rất ít người biết điều này”. Trước đó, Diamandis viết đại ý rằng yếu tố giới hạn tốc độ thực sự trong kỷ nguyên AI agent không phải là năng lực tính toán, mà là bộ nhớ.
Phản ứng của Musk nối tiếp nhận định trước đó rằng nhu cầu bộ nhớ AI có thể tăng hơn 200% mỗi năm. Trong cuộc gọi báo cáo kết quả kinh doanh quý II của SpaceX, ông từng nói tốc độ tăng sản lượng bộ nhớ chỉ ở mức khoảng 20%/năm, trong khi tốc độ tăng nhu cầu có thể vượt 200%/năm.
Phát biểu khi đó cho thấy trong cuộc đua mở rộng trung tâm dữ liệu AI, nguồn cung bộ nhớ đã trở nên quan trọng không kém GPU. Khi quy mô mô hình AI và mức sử dụng suy luận cùng tăng, nút thắt không chỉ nằm ở thiết bị tính toán mà còn ở thiết bị lưu trữ ngữ cảnh.
Vấn đề kỹ thuật cốt lõi nằm ở “bộ nhớ đệm KV” (KV cache). Khi xử lý token đầu vào, các mô hình ngôn ngữ lớn (LLM) tạo ra dữ liệu khóa - giá trị chứa mối quan hệ ngữ cảnh và lưu vào bộ nhớ. Nhờ dữ liệu này, mô hình có thể tiếp tục xử lý ngữ cảnh trước đó mà không phải tính toán lại từ đầu mỗi lần.
Với chatbot hội thoại thông thường, mỗi lượt hỏi đáp tương đối ngắn. Ngược lại, AI agent phải nối tiếp nhiều bước như lập trình, tìm kiếm, phân tích, đồng thời liên tục gọi lại các phán đoán và lịch sử thao tác trước đó. Khi lượng ngữ cảnh cần lưu trữ tăng lên, chỉ riêng HBM bên trong GPU sẽ khó đáp ứng.
Tại CES năm nay, NVIDIA (NVDA) đã giới thiệu nền tảng Inference Context Memory Storage Platform. Theo tài liệu của NVIDIA, việc phân bổ bộ nhớ đệm KV qua nhiều tầng gồm HBM trên GPU, bộ nhớ hệ thống, ổ SSD và kho lưu trữ dùng chung có thể giúp tăng thông lượng token xử lý mỗi giây cũng như hiệu quả điện năng tối đa 5 lần so với phương thức lưu trữ hiện tại, trong các tác vụ suy luận ngữ cảnh dài và dạng agent.
Cấu trúc này mở rộng trọng tâm của cuộc cạnh tranh chip AI. Trước đây, hiệu năng tính toán và nguồn cung GPU là mối quan tâm chính, nhưng với suy luận dạng agent, việc lưu ngữ cảnh ở đâu và gọi lại nhanh đến mức nào mới là yếu tố quyết định chi phí và thông lượng xử lý.
Xu hướng Microsoft (MSFT) nhấn mạnh hiệu quả chi phí của chip tăng tốc suy luận AI Maia 200 cũng xuất phát từ cùng vấn đề này. Với dịch vụ AI tạo sinh, chi phí lặp lại ở giai đoạn suy luận thường lớn hơn giai đoạn huấn luyện, nên việc cải thiện thông lượng và hiệu quả điện năng tác động trực tiếp đến chi phí vận hành.
Trong bản cập nhật hàng tháng về NAND flash công bố ngày 21/7, TrendForce cho biết thị trường NAND năm 2026 đang ở trạng thái thiếu hụt nguồn cung do nhu cầu AI tăng trong khi năng lực mở rộng sản xuất còn hạn chế. TrendForce ước tính tỷ lệ thiếu hụt nguồn cung NAND năm 2026 ở mức 4-5%, đồng thời cho biết máy chủ chiếm hơn 40% tổng nhu cầu NAND tính theo bit.
TrendForce nhận định tình trạng hạn chế nguồn cung có thể được nới lỏng từ nửa cuối năm 2027. Điều này cho thấy việc mở rộng hạ tầng AI không chỉ tác động đến nhu cầu ngắn hạn, mà còn ảnh hưởng đến tốc độ mở rộng sản xuất và điều kiện hợp đồng cung ứng dài hạn của các hãng bộ nhớ.
Thị trường Hàn Quốc gắn liền trực tiếp với chiến lược cung ứng HBM và NAND của Samsung Electronics và SK Hynix. Trong cuộc gọi báo cáo kết quả kinh doanh quý II ngày 29/7, SK Hynix cho biết nhu cầu vẫn duy trì vững nhờ đầu tư hạ tầng AI mở rộng và môi trường cung ứng thắt chặt.
Tuy nhiên, triển vọng lợi nhuận của ngành bộ nhớ không chỉ được quyết định bởi nhu cầu tăng đơn thuần. Mức độ thiếu hụt nguồn cung và khả năng sinh lời còn phụ thuộc vào giá hợp đồng cung ứng dài hạn, tốc độ mở rộng sản xuất của các hãng Trung Quốc và nhịp độ đầu tư trung tâm dữ liệu.
Sự lan rộng của AI agent đang kéo trọng tâm nhu cầu chất bán dẫn từ GPU sang các tầng bộ nhớ và lưu trữ. Phản ứng lần này của Musk không đưa ra số liệu mới, mà được xem như tín hiệu tái khẳng định nút thắt bộ nhớ trong đầu tư hạ tầng AI.
Bình luận 0