OpenAI vừa công bố kết quả hiệu năng của Jalapeño, chip suy luận (inference) tùy chỉnh đầu tiên do công ty phát triển cùng Broadcom(AVGO). Theo kết quả thử nghiệm trên các mô hình mã nguồn mở, thông lượng xử lý trên mỗi đơn vị điện năng cao hơn 1,5-1,9 lần, trong khi độ trễ đầu cuối (end-to-end latency) giảm 1,7-3,6 lần so với trước.
Trong báo cáo kỹ thuật công bố ngày 25, OpenAI cho biết Jalapeño đạt được các chỉ số nói trên khi chạy thử nghiệm trên các mô hình GPT-OSS 120B, DeepSeek R1 và Kimi K2.5 1T. Công ty cũng cho biết thêm rằng với khối lượng suy luận dạng hội thoại, hiệu năng của chip cao hơn 2,1-4,1 lần.
Jalapeño là bộ gia tốc (accelerator) chuyên dụng đầu tiên mà OpenAI thiết kế riêng cho suy luận mô hình ngôn ngữ lớn (LLM). Hồi tháng 6, OpenAI và Broadcom(AVGO) đã công bố con chip này, cho biết quá trình từ thiết kế đến tape-out sản xuất mất 9 tháng, trong đó chính các mô hình của OpenAI đã hỗ trợ đẩy nhanh một phần quá trình phát triển.
OpenAI cho biết sẽ bắt đầu triển khai Jalapeño vào hạ tầng điện toán của riêng công ty từ nay đến cuối năm. Công ty khẳng định vẫn sẽ tiếp tục sử dụng rộng rãi các bộ gia tốc từ các đối tác, bao gồm NVIDIA(NVDA), cho cả tác vụ huấn luyện (training) lẫn suy luận.
Bình luận 0