Back to top
  • 공유 Chia sẻ
  • 인쇄 In
  • 글자크기 Cỡ chữ
URL đã được sao chép

Ling-3.0-flash 124 tỷ tham số, chỉ dùng 5,1 tỷ mỗi token

Bo mạch suy luận AI bên cạnh giá máy chủ trung tâm dữ liệu / TokenPost.ai

Ant Group (Tập đoàn Ant), thông qua tổ chức AI inclusionAI, đã ra mắt mô hình ngôn ngữ lớn Ling-3.0-flash với tổng cộng 124 tỷ tham số, nhưng chỉ kích hoạt 5,1 tỷ tham số cho mỗi token. Theo thông tin, dung lượng của phiên bản lượng tử hóa FP8 chỉ bằng khoảng một nửa phiên bản BF16, ở mức khoảng 128GB.

BlockBeats (Trung Quốc) đưa tin ngày 5 rằng cả phiên bản gốc BF16 và phiên bản lượng tử hóa FP8 của Ling-3.0-flash đã được đăng tải lên Hugging Face và ModelScope theo giấy phép MIT, cho phép các nhà phát triển tự triển khai bằng SGLang hoặc vLLM. Theo số liệu mà BlockBeats đưa ra, dung lượng phiên bản BF16 khoảng 255GB, còn phiên bản FP8 khoảng 128GB.

Tài liệu chính thức của Ant Ling mô tả Ling-3.0-flash là mô hình "hỗn hợp chuyên gia" (Mixture-of-Experts, MoE). Cấu trúc hỗn hợp chuyên gia chỉ kích hoạt một phần mạng chuyên gia tùy theo đầu vào, giúp giảm khối lượng tính toán thực tế trong khi vẫn duy trì quy mô tổng thể của mô hình.

Tài liệu chính thức cho biết mô hình này hỗ trợ mặc định cửa sổ ngữ cảnh 256K và có thể mở rộng lên tới 1 triệu token. Tài liệu giải thích rằng trong các tác vụ có tần suất cao, mô hình đặt mục tiêu đạt tốc độ suy luận đỉnh tối đa 1.000 token mỗi giây và thời gian phản hồi token đầu tiên (TTFT) dưới 100ms.

Trong thông cáo báo chí chính thức ngày 27/7, Ant Group cho biết Ling-3.0-flash áp dụng cấu trúc chú ý tuyến tính lai gốc (native hybrid linear attention), xen kẽ các lớp KDA (Kimi Delta Attention) và MLA (Multi-head Latent Attention) theo tỷ lệ 5:1. Tỷ lệ kích hoạt chuyên gia so với thế hệ trước cũng được giảm từ 1/32 xuống 1/64.

FP8 là định dạng lưu trữ tham số với độ chính xác thấp hơn BF16, giúp giảm dung lượng trọng số và mức sử dụng bộ nhớ. Theo số liệu mà BlockBeats cung cấp, dung lượng phiên bản FP8 nhỏ hơn khoảng một nửa so với phiên bản BF16. Tuy nhiên, tính đến ngày 5, tài liệu mô hình chính thức của Ant Ling có thể tra cứu được tổng số tham số, tham số kích hoạt và cửa sổ ngữ cảnh, trong khi thẻ mô hình (model card) tương ứng trên Hugging Face lại có thông tin hạn chế hơn.

Tài liệu giá chính thức của Ant Ling cho biết Ling-3.0-flash được cung cấp miễn phí từ 1 giờ sáng ngày 23/7 đến 0 giờ 59 phút 59 giây ngày 7/8 theo giờ Hàn Quốc. Trong tháng 8, mức giảm giá 75% sẽ được áp dụng, còn giá thông thường là 0,40 nhân dân tệ cho mỗi 1 triệu token đầu vào và 1,20 nhân dân tệ cho mỗi 1 triệu token đầu ra.

Thông báo lần này không đề cập đến mối liên hệ trực tiếp nào với tiền mã hóa hay blockchain. Các nhóm phát triển muốn vận hành AI dạng tác nhân (agentic AI) trên máy chủ riêng hoặc đám mây riêng tư nên kiểm tra thẻ mô hình, tệp giấy phép và checksum trước khi triển khai thực tế.

<Bản quyền ⓒ TokenPost, nghiêm cấm sao chép và phân phối trái phép>

Phổ biến nhất

Các bài viết liên quan khác

Bình luận 0

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.

0/1000

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.
1