Liquid AI vừa ra mắt mô hình AI tác nhân (agent) chạy trên thiết bị (on-device) mang tên "LFM2.5-2.6B", với 2,69 tỷ tham số. Trong bộ benchmark nội bộ, một số điểm số về thực thi chỉ dẫn (instruction following) và sử dụng công cụ (tool use) của mô hình này vượt qua Qwen3.5-9B.
Liquid AI cho biết trên blog chính thức ngày 4 (giờ địa phương) rằng công ty đã công bố LFM2.5-2.6B cùng mô hình nền "LFM2.5-2.6B-Base" trên Hugging Face. Mô hình có kích thước nhỏ, được thiết kế để xử lý việc gọi công cụ, tác vụ nhiều bước và đầu ra có cấu trúc ngay trên thiết bị cục bộ.
LFM2.5-2.6B được huấn luyện trước (pretrain) trên khoảng 34 nghìn tỷ token. Sau giai đoạn mở rộng ngữ cảnh 128K, mô hình hỗ trợ tối đa 131.072 token ngữ cảnh, gồm 30 lớp (layer) và bộ từ vựng quy mô 128.000 mục.
Mô hình được huấn luyện trong môi trường tác nhân (agent harness) thực tế, bao gồm việc sử dụng công cụ, prompt hệ thống và tác vụ nhiều lượt hội thoại. Agent harness là môi trường thực thi giúp mô hình lựa chọn công cụ bên ngoài, nhận kết quả rồi thực hiện bước tiếp theo.
Quá trình huấn luyện áp dụng tinh chỉnh có giám sát (supervised fine-tuning), chuyên biệt hóa mô hình giáo viên (teacher model), chưng cất on-policy đa lĩnh vực (multi-domain on-policy distillation) và học tăng cường cho tác nhân (agentic reinforcement learning). Chưng cất (distillation) là phương pháp chuyển giao năng lực từ mô hình hiệu suất cao sang mô hình nhỏ hơn, dựa trên câu trả lời và phán đoán của mô hình lớn.
Liquid AI giải thích công ty đã xây dựng các mô hình giáo viên chuyên biệt theo từng lĩnh vực — thực thi chỉ dẫn, toán học, kiến thức, mã nguồn, sử dụng công cụ và xử lý ngữ cảnh dài — rồi tích hợp tất cả vào một mô hình học sinh (student model) duy nhất. Việc suy luận diễn ra ngay trên thiết bị mà không cần qua API đám mây, nhằm giảm độ trễ và gánh nặng xử lý dữ liệu cá nhân.
Theo bảng đánh giá do công ty công bố, điểm IFBench của LFM2.5-2.6B đạt 59,17, cao hơn mức 56,47 của Qwen3.5-9B. Ở bài test Multi-IF, kết quả là 80,07 so với 62,55; còn IFStruct đạt 85,49 so với 78,50.
Ở bài đánh giá khả năng sử dụng công cụ ToolSandbox, LFM2.5-2.6B đạt 77,83 điểm, vượt mức 76,44 của Qwen3.5-9B. Tuy nhiên, đây là kết quả đánh giá nội bộ do Liquid AI tự công bố; hiện chưa có tổ chức độc lập nào tái hiện kết quả này trong cùng điều kiện.
Không phải ở mọi bài test mô hình nhỏ đều vượt trội. Tại BFCLv4, Qwen3.5-9B đạt 60,13 điểm, cao hơn mức 56,88 của LFM2.5-2.6B; mô hình của Qwen cũng chiếm ưu thế ở cả AIME25 và LiveCodeBenchv6.
Liquid AI khuyến nghị sử dụng LFM2.5-2.6B cho các tác vụ sử dụng công cụ, trích xuất dữ liệu, tạo sinh tăng cường truy xuất (RAG) và xử lý ngữ cảnh dài. Ngược lại, công ty không khuyến nghị dùng mô hình này cho lập trình theo hướng tác nhân (agentic coding) hay các tác vụ đòi hỏi nhiều kiến thức chuyên sâu, đồng thời cho biết mô hình lớn hơn có thể phù hợp hơn với tác vụ phức tạp hoặc thiên về lập trình.
Trong thử nghiệm trên thiết bị thực tế, tốc độ giải mã (decoding) đạt 220 token/giây trên Apple M5 Max và 113 token/giây trên AMD Ryzen AI Max+ 395. Công ty cho biết mức sử dụng bộ nhớ dưới 2,5GB, và trên điện thoại thông minh, mô hình vẫn đạt khoảng 30 token/giây.
Mô hình mới nằm trong xu hướng mở rộng của các mô hình AI cỡ nhỏ chạy trực tiếp trên thiết bị như smartphone. Tuy nhiên, Liquid AI chưa công bố bất kỳ liên kết trực tiếp nào với dự án blockchain, token hay sàn giao dịch cụ thể.
Các tác nhân AI cục bộ trong tương lai có thể được ứng dụng vào bảo mật ví hoặc công cụ phân tích dữ liệu on-chain, song khả năng ứng dụng thực tế còn phụ thuộc vào mức độ đón nhận của giới lập trình viên và các kết quả kiểm chứng độc lập. Trọng số mô hình và mô hình nền đã được công bố công khai trên Hugging Face.
Nguồn xác minh: blog chính thức của Liquid AI, trang mô hình trên Hugging Face.
Bình luận 0