Back to top
  • 공유 Chia sẻ
  • 인쇄 In
  • 글자크기 Cỡ chữ
URL đã được sao chép

81.2 điểm, DeepSeek giảm 70 lần chi phí thiết kế web

Bàn tay và laptop so sánh dữ liệu đánh giá thiết kế web / TokenPost.ai (macro)

Mô hình V4.1 Flash của DeepSeek đạt 81.2 điểm trong bài đánh giá thiết kế web, chỉ kém GPT-6 Astra của OpenAI 1.5 điểm. Chi phí trung bình cho mỗi thiết kế của V4.1 Flash là 0.023 USD (khoảng 31 won), thấp hơn khoảng 70 lần so với Astra.

Nền tảng đánh giá OpenDesign Arena đã so sánh 13 mô hình trí tuệ nhân tạo, dựa trên năng lực tạo ứng dụng web, bảng điều khiển (dashboard), giao diện di động và trang đích (landing page). GPT-6 Astra đứng đầu với 82.7 điểm, còn V4.1 Flash của DeepSeek xếp thứ hai.

Chênh lệch chi phí giữa hai mô hình là 1.61 USD (khoảng 2165 won) so với 0.023 USD (khoảng 31 won). Trong khi đó, Claude Fable 5.1 của Anthropic đạt 80.3 điểm nhưng chi phí cho mỗi tác vụ lên tới 3.66 USD (khoảng 4923 won).

Về thời gian xử lý, V4.1 Flash cũng nhanh hơn. Thời gian trung bình cho mỗi tác vụ là 5.3 phút, ít hơn 5.8 phút so với 11.1 phút của Astra, trong khi Claude Fable 5.1 mất tới 12.8 phút.

V4.1 Flash chính thức ra mắt vào ngày 10 tháng này. Trước đó, DeepSeek từng cho biết V4.1 Flash dự kiến ra mắt vào khoảng ngày 10 tháng 9.

V4.1 Flash là mô hình hỗn hợp chuyên gia (MoE) với tổng cộng 552 tỷ tham số, nhưng chỉ kích hoạt khoảng 8 tỷ tham số khi xử lý đầu vào và khoảng 16 tỷ tham số khi tạo đầu ra.

Mô hình hỗn hợp chuyên gia không kích hoạt toàn bộ tham số trong mỗi lần vận hành, mà chỉ kích hoạt phần cần thiết cho từng tác vụ. DeepSeek gọi cấu trúc này là “kiến trúc bất đối xứng”, cho biết cách tiếp cận này chỉ thực hiện các phép tính cần thiết, qua đó giảm chi phí và rút ngắn thời gian xử lý.

Tỷ lệ kết quả có thể sử dụng ngay mà không cần chỉnh sửa trên OpenDesign Arena cao nhất thuộc về Astra với 60%, tiếp theo là V4.1 Flash với 57.7% và Claude Fable 5.1 với 56.7%.

Như vậy, V4.1 Flash vượt trội về chi phí và thời gian xử lý, nhưng lại kém Astra 2.3 điểm phần trăm về khả năng sử dụng kết quả ngay lập tức. Điều này cho thấy hiệu năng và hiệu quả không phải lúc nào cũng đồng nhất ở mọi tiêu chí.

Đánh giá lần này chỉ giới hạn ở các tác vụ thiết kế web, gồm ứng dụng web, dashboard, giao diện di động và trang đích. Vì vậy chưa thể khẳng định các mô hình này sẽ có kết quả tương tự ở những lĩnh vực khác như lập trình, suy luận logic hay nghiên cứu khoa học.

Lợi thế chi phí của V4.1 Flash đến từ cấu trúc giúp giảm khối lượng tính toán cần thiết cho suy luận thực tế, trong khi vẫn duy trì dung lượng tri thức tổng thể của một mô hình quy mô lớn. Tuy nhiên, chi phí và tốc độ dịch vụ thực tế có thể thay đổi tùy theo độ dài đầu vào, cách thức yêu cầu và điều kiện máy chủ.

TokenPost từng đưa tin tốc độ đầu ra của V4.1 Flash đạt 420 token mỗi giây trong một bài kiểm tra nội bộ trước đó, nhưng cũng lưu ý rằng đối tượng so sánh và điều kiện đo lường khi đó không hoàn toàn giống nhau, nên việc so sánh đơn thuần vẫn có giới hạn.

Khi việc sử dụng các mô hình chi phí thấp ngày càng phổ biến, chi phí cho mỗi tác vụ và thời gian xử lý có thể trở thành tiêu chí quan trọng khi lựa chọn mô hình. Ngược lại, nhu cầu chỉnh sửa kết quả, độ chính xác theo từng tác vụ và độ ổn định của dịch vụ vẫn cần được kiểm chứng riêng.

Khi công bố V4.1 Flash, DeepSeek cho biết: “Nhờ kiến trúc hiệu quả hơn, chúng tôi có thể phục vụ nhiều người dùng hơn với chi phí thấp hơn”, đồng thời khẳng định “đang chuyển phần chi phí tiết kiệm được cho người dùng”.

Kết quả này cho thấy V4.1 Flash đã đạt được điểm số gần bằng Astra trong lĩnh vực thiết kế web, đồng thời duy trì mức chi phí thấp hơn đáng kể.

<Bản quyền ⓒ TokenPost, nghiêm cấm sao chép và phân phối trái phép>

Phổ biến nhất

Các bài viết liên quan khác

Bình luận 0

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.

0/1000

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.
1