Qwen 3.8 Flash đạt tốc độ tạo 18-21 token/giây khi độ dài ngữ cảnh của mô hình AI cục bộ vượt 100.000 token, giảm khoảng 30-40% so với mức 28-33 token/giây ở ngữ cảnh ngắn.
Vitalik Buterin (Vitalik Buterin) đồng sáng lập Ethereum đã công bố kết quả đo trên máy tính xách tay sử dụng nền tảng AMD Strix Halo. Ông chạy Qwen 3.8 Flash bằng framework suy luận mã nguồn mở llama.cpp. ChainNews (ABMedia) đưa tin ông đã công bố bảng hiệu năng của 10 bài kiểm tra.
Bảng dữ liệu gồm độ dài prompt hiện tại, độ dài prompt mới nhập, số token được tạo, tốc độ xử lý đầu vào và tốc độ đầu ra. Các bài kiểm tra được chia thành hai nhóm theo độ dài ngữ cảnh hiện tại: ngữ cảnh ngắn và ngữ cảnh dài.
Trong 6 bài kiểm tra có ngữ cảnh hiện tại từ 2.136 đến 7.799 token, tốc độ đầu ra đạt 28,07-33,37 token/giây. Mức nhanh nhất là 33,37 token/giây, còn mức thấp nhất là 28,07 token/giây.
Ở 4 bài kiểm tra có ngữ cảnh hiện tại từ 104.535 đến 107.402 token, tốc độ đầu ra được đo ở mức 18,42-20,78 token/giây. So với nhóm ngữ cảnh ngắn, tốc độ đầu ra thấp hơn khoảng 30-40%.
Tốc độ xử lý đầu vào cũng khác nhau theo độ dài ngữ cảnh. Ở nhóm ngữ cảnh ngắn, tốc độ đạt 300-373 token/giây, ngoại trừ một lần đo. Trong nhóm ngữ cảnh dài, tốc độ giảm xuống còn 150-198 token/giây.
Lần đo ngoại lệ ở nhóm ngữ cảnh ngắn ghi nhận tốc độ xử lý đầu vào 109,82 token/giây. Bài kiểm tra này có prompt hiện tại dài 2.136 token và prompt mới nhập dài 110 token.
Token là đơn vị cơ bản để mô hình AI xử lý và tạo câu. Độ dài ngữ cảnh chỉ phạm vi thông tin đầu vào mà mô hình có thể tham chiếu trong một lần xử lý. Khi ngữ cảnh dài hơn, lượng thông tin mô hình phải xử lý cũng tăng lên.
Kết quả lần này so sánh sự thay đổi hiệu năng theo độ dài ngữ cảnh trên cùng một máy tính xách tay. Độ chính xác lượng tử hóa của mô hình, cấu hình bộ nhớ, thông số chi tiết và thiết lập công suất của Strix Halo chưa được công bố.
Do đó, khó có thể so sánh trực tiếp các con số này với kết quả đo trên máy tính khác. Tốc độ đầu vào và đầu ra của cùng một mô hình có thể thay đổi tùy phần cứng và thiết lập chạy.
Buterin cho biết hiệu quả xử lý mô hình nói trên của llama.cpp đang được cải thiện nhanh chóng. Ông đánh giá mô hình cục bộ “đang tiến gần đến điểm có thể trực tiếp xử lý phần lớn tác vụ”. Nhận định này cho thấy ông kỳ vọng khả năng sử dụng mô hình cục bộ sẽ tiếp tục được mở rộng, nhưng chưa phải kết luận áp dụng cho mọi thiết bị.
Vitalik Buterin (Vitalik Buterin) đồng sáng lập Ethereum cũng đề xuất sử dụng mô hình cục bộ như một lớp điều phối nhằm bảo vệ quyền riêng tư. Ông nói quy trình trong đó “mô hình cục bộ điều phối các truy vấn tới mô hình mạnh hơn để câu hỏi chứa thông tin riêng tư không bị rò rỉ” đang bắt đầu trở nên khả thi. Cách tiếp cận này đặt mô hình cục bộ ở bước xử lý đầu tiên trước khi dữ liệu được chuyển ra ngoài.
Trong quy trình này, mô hình cục bộ xử lý câu hỏi của người dùng trước, sau đó phân loại nội dung nào sẽ gửi tới mô hình đám mây và nội dung nào được giữ lại trên thiết bị. Điểm cốt lõi là các yêu cầu chứa thông tin nhạy cảm có thể không cần được gửi nguyên trạng tới máy chủ bên ngoài.
Trước đó, Buterin cho biết chi phí triển khai và mức độ thuận tiện khi sử dụng rất quan trọng để phổ biến công nghệ quyền riêng tư. Kết quả lần này là số liệu đo cho thấy sự khác biệt về tốc độ xử lý của mô hình AI cục bộ theo độ dài ngữ cảnh trên một mẫu máy tính xách tay cụ thể.
Tuy nhiên, đây vẫn là kết quả đo trong một thiết bị và môi trường chạy cụ thể. Để đánh giá khả năng ứng dụng thực tế của mô hình AI cục bộ, cần có thêm các bài kiểm tra công bố đồng thời thiết lập mô hình, cấu hình bộ nhớ và điều kiện công suất.
Bình luận 0