Startup Pháp Kog vừa giới thiệu chiến lược tăng tốc suy luận AI ngay trên các GPU trung tâm dữ liệu phổ thông, thay vì phát triển chip suy luận chuyên dụng mới. Cách tiếp cận của công ty là đồng thiết kế phần mềm và kiến trúc mô hình để khai thác tối đa GPU của Nvidia(NVDA) và AMD.
TechCrunch đưa tin Kog cho rằng quan điểm phổ biến cho rằng GPU không phù hợp cho suy luận trong các quy trình dạng agent là một hiểu lầm. Cũng trong bài viết này, Gaël Delalleau, nhà sáng lập kiêm CEO của Kog, nói "GPU vẫn còn tương lai tươi sáng". Theo ông, GPU hiện có hoàn toàn có thể phục vụ thị trường suy luận lâu dài và hiệu quả hơn nữa.
Điểm Kog nhắm tới là tốc độ phản hồi cho một yêu cầu đơn lẻ của người dùng. Các AI agent thường lặp lại tuần tự các bước lập kế hoạch, viết mã, kiểm thử rồi chỉnh sửa. Khi một bước xử lý chậm, các bước sau cũng bị kéo theo, nên độ trễ của từng yêu cầu quyết định tốc độ chung của cả tác vụ.
Để giảm nút thắt này, công ty cho biết đã gộp runtime, kernel GPU và kiến trúc mô hình thành một pipeline tối ưu độ trễ duy nhất. Nếu phần lớn cuộc đua hạ tầng AI hiện nay tập trung vào việc dựng mô hình lớn hơn và gom nhiều bộ tăng tốc hơn, Kog chọn hướng khai thác phần hiệu năng còn lại trên các GPU đã lắp đặt sẵn tại trung tâm dữ liệu.
Trong bản xem trước kỹ thuật của công cụ Kog Inference Engine công bố ngày 28/5, công ty đưa ra con số 3.000 token đầu ra mỗi giây cho một yêu cầu, đo trên cụm 8 GPU AMD MI300X. Với cụm 8 GPU Nvidia H200 trong cùng điều kiện, con số ghi nhận là 2.100 token đầu ra mỗi giây cho một yêu cầu. Điều kiện đo gồm FP16, kích thước lô (batch size) bằng 1 và không dùng giải mã suy đoán (speculative decoding).
Các số liệu này chủ yếu đến từ blog và bản demo do chính Kog công bố. Trang web công ty cũng giới thiệu sản phẩm với tốc độ 3.000 token/giây cho mỗi yêu cầu, nhanh hơn 30 lần, và xác định AI coding agent cùng các quy trình dạng agent là đối tượng ứng dụng chính.
Ngày 24/6, Kog tiếp tục công bố mô hình Laneformer 2B trên Hugging Face. Bài viết trên Hugging Face mô tả đây là mô hình lập trình đã tinh chỉnh theo chỉ dẫn (instruction-tuned) với 2,3 tỷ tham số, đạt 45,1% trên HumanEval+ và 51,6% trên MBPP+. Con số khoảng 2 tỷ tham số mà TechCrunch nêu có chênh lệch đôi chút, nhưng cả hai nguồn đều thống nhất đây là một mô hình lập trình cỡ nhỏ.
Trang chính thức của sự kiện AMD AI DevDay 2026 cũng giới thiệu phần trình bày kỹ thuật của Kog. Trang này mô tả phiên của Kog là một stack suy luận thời gian thực, đặt mục tiêu tạo 2.500 token mỗi giây cho một yêu cầu trên GPU AMD Instinct. Trong bài đăng LinkedIn hồi tháng 8, Kog cũng cho biết bản demo thực tế đạt 2.857 token/giây.
Vấn đề gây tranh cãi nằm ở cách hiểu các con số tốc độ này. Bên dưới bài đăng LinkedIn, ngoài phản hồi tích cực còn có câu hỏi về việc điều kiện so sánh có tương đồng hay không. Một bình luận khác chỉ ra rằng Cerebras từng đạt tốc độ tương tự nhưng trên mô hình lớn hơn. Cùng một số token mỗi giây nhưng nếu quy mô mô hình, phần cứng, kích thước lô, độ chính xác và cách giải mã khác nhau thì rất khó so sánh trực tiếp.
Suy luận (inference) là quá trình mô hình AI đã huấn luyện thực hiện để trả lời câu hỏi hoặc sinh mã. Token là đơn vị cơ bản mà mô hình dùng để xử lý câu chữ. Số token đầu ra mỗi giây mà mô hình tạo ra cho một yêu cầu của người dùng ảnh hưởng trực tiếp đến tốc độ trải nghiệm trên chatbot, công cụ lập trình và các dịch vụ tự động hóa dạng agent.
Xét về cấu trúc thị trường, cuộc đua suy luận AI không chỉ dừng ở hiệu năng chip. Việc có đủ GPU, tốc độ di chuyển dữ liệu, tối ưu kernel, kiến trúc mô hình và cách xử lý theo lô đều gắn chặt với nhau. Đây cũng là lý do Kog nhấn mạnh việc đồng thiết kế phần mềm và mô hình.
Với độc giả quan tâm đến ngành, đây là một lát cắt trong cuộc đua hạ tầng suy luận mà các dịch vụ AI dạng agent đang đòi hỏi. TokenPost từng đưa tin về cuộc đua hạ tầng suy luận nhằm rút ngắn thời gian GPU chờ dữ liệu.
Tuy nhiên, mối liên hệ trực tiếp giữa Kog và các dự án blockchain chưa được xác nhận. Trọng tâm của bài viết này không phải là phát hành token hay tích hợp blockchain, mà là cách các dịch vụ AI dạng agent đảm bảo độ trễ thấp trên hạ tầng GPU hiện có.
Thử thách của Kog là chứng minh cách tiếp cận này vẫn hiệu quả ngoài phạm vi demo nội bộ, khi áp dụng cho mô hình lớn hơn và môi trường vận hành thực tế. CEO Delalleau nói với TechCrunch rằng nếu đạt tốc độ gấp 10 lần cho mô hình lớn đầu tiên trước tháng 9, công ty có thể bắt đầu thu hút khách hàng và khởi động các cuộc thảo luận gọi vốn vòng Series A. Đây vẫn là kế hoạch chưa thực hiện.
Bình luận 0