NVIDIA(NVDA) đang mở rộng cửa ngõ tiếp cận với giới phát triển bằng loạt mô hình AI mã nguồn mở và API suy luận miễn phí. Chiến lược này được cho là nhằm để nhà phát triển dùng thử mô hình trước, sau đó dẫn dắt họ sang môi trường triển khai chạy trên GPU của NVIDIA.
Ngày 11 tháng 8, NVIDIA công bố trên blog chính thức mô hình Nemotron 3.5 Lightning. Đây là mô hình có cấu trúc hỗn hợp chuyên gia (MoE - Mixture of Experts) với tổng cộng 30 tỷ tham số, trong đó 3 tỷ tham số được kích hoạt.
Cấu trúc hỗn hợp chuyên gia là cách chỉ kích hoạt một phần mô hình chuyên gia ứng với mỗi đầu vào, giúp giảm khối lượng tính toán. Nemotron 3.5 Lightning được thiết kế cho các tác vụ xử lý ngữ cảnh dài và AI dạng tác nhân (agentic AI), hỗ trợ ngữ cảnh tối đa 1 triệu token.
Mô hình này có thể tải xuống trên Hugging Face và NVIDIA NGC. Trên trang mô hình của Hugging Face, thông tin công bố ghi ngày phát hành 11 tháng 8, giấy phép OpenMDW 1.1 và cho phép sử dụng thương mại.
NVIDIA NGC cho biết container này cung cấp API tương thích OpenAI, có thể dùng cho AI tác nhân, chatbot, tạo sinh tăng cường truy xuất (RAG) và hỗ trợ lập trình. Nhà phát triển có thể trực tiếp thử nghiệm trọng số mô hình, container triển khai và API suy luận.
Theo xác nhận vào ngày 25 (giờ Hàn Quốc), trang mô hình của NVIDIA hiển thị tổng cộng 126 mô hình. Trong số này, 58 mô hình có endpoint miễn phí và 102 mô hình có thể tải xuống.
Cùng trang này còn giới thiệu API serverless miễn phí dành cho phát triển và dịch vụ vi mô suy luận NVIDIA NIM. API miễn phí phục vụ thử nghiệm ban đầu và so sánh hiệu năng, trong khi NIM gắn với cấu hình dịch vụ suy luận ở giai đoạn triển khai thực tế.
Diễn biến này nối tiếp việc NVIDIA công bố Nemotron 3.5 mà TokenPost đã đưa tin trước đó. NVIDIA không chỉ dừng lại ở việc ra mắt các mô hình suy luận lớn, mà còn kết hợp thêm các mô hình lớp thực thi nhỏ gọn cùng công cụ định tuyến.
Cũng trong ngày 11 tháng 8, NVIDIA công bố NeMo Switchyard, một thư viện định tuyến mã nguồn mở giúp phân chia mô hình theo tính chất tác vụ. NVIDIA cho biết trên blog kỹ thuật rằng công cụ này phân bổ tác vụ dựa trên tín hiệu về hiệu năng mô hình, chi phí và hạ tầng.
AI dạng tác nhân thường thực hiện lặp lại nhiều bước tác vụ, khác với chatbot chỉ trả lời một câu hỏi. Thay vì giao toàn bộ yêu cầu cho mô hình lớn, cấu trúc dùng mô hình nhẹ cho tác vụ lặp lại và chỉ chuyển các phán đoán phức tạp sang mô hình lớn được dùng để giảm chi phí và độ trễ.
Trước đó, ngày 4 tháng 6, NVIDIA cũng đã công bố Nemotron 3 Ultra. Đây là mô hình MoE cỡ lớn với tổng cộng 550 tỷ tham số, trong đó 55 tỷ tham số được kích hoạt.
Tài liệu chính thức cho biết Nemotron 3 Ultra hỗ trợ ngữ cảnh tối đa 1 triệu token và các tác vụ tác nhân kéo dài. Trong khi đó, Nemotron 3.5 Lightning được giới thiệu là mô hình ở lớp thực thi nhỏ hơn, tập trung xử lý nhanh các tác vụ chuyên biệt.
Lớp phần mềm cũng được mở rộng song song. Blog kỹ thuật của NVIDIA cho biết Dynamo 1.0 giúp tăng thông lượng xử lý yêu cầu tối đa 7 lần trên môi trường nền tảng Blackwell.
Con số này được đưa ra dựa trên benchmark InferenceX của SemiAnalysis, cập nhật ngày 3 tháng 3. NVIDIA đang xây dựng cấu trúc cung cấp đồng thời mô hình, container và phần mềm tối ưu suy luận, để nhà phát triển có thể tự kiểm chứng hiệu năng trên chính môi trường phần cứng của hãng.
Chiến lược mô hình miễn phí của NVIDIA đưa ra một lựa chọn khác biệt so với xu hướng phát triển AI tập trung vào API dạng đóng. Tuy nhiên, hiệu quả tiết kiệm chi phí thực tế hay mức tăng nhu cầu GPU còn tùy thuộc vào môi trường triển khai, mức sử dụng và cấu hình phần cứng của từng doanh nghiệp.
Bình luận 0