Một công nghệ liên lạc cho phép các mô hình ngôn ngữ lớn (LLM) trực tiếp trao đổi KV-cache, tức trạng thái nội bộ, thay vì văn bản đã được công bố. Nhóm nghiên cứu Đại học Thanh Hoa cho biết phương pháp này giúp giảm 2,5 lần độ trễ liên lạc trung bình giữa các mô hình so với cách truyền dữ liệu dựa trên văn bản.
Phương pháp 'Cache-to-Cache (C2C)' do nhóm nghiên cứu đề xuất chuyển KV-cache của một mô hình sang không gian biểu diễn của mô hình khác, sau đó kết hợp hai phần này. Bài nghiên cứu lần đầu được công bố ngày 3 tháng 10 năm 2025, sửa đổi ngày 2 tháng 3 năm 2026 và được đăng trong kỷ yếu ICLR 2026.
Trong các hệ thống đa LLM hiện nay, một mô hình tạo kết quả phân tích dưới dạng văn bản rồi mô hình khác đọc lại nội dung đó. Quá trình này nén thông tin bậc cao bên trong mô hình thành câu chữ, đồng thời phát sinh độ trễ do token được tạo tuần tự.
C2C chiếu KV-cache của mô hình cung cấp thông tin, gọi là 'Sharer', thông qua một mạng nơ-ron 'Cache Fuser', rồi kết hợp với cache của mô hình tiếp nhận, gọi là 'Receiver'. Cổng có thể học sẽ lựa chọn tầng nào của Receiver nhận thông tin.
KV-cache là trạng thái nội bộ dưới dạng các khóa và giá trị được mô hình tích lũy khi xử lý dữ liệu đầu vào trước đó. Khi ngữ cảnh dài hơn, cache cũng lớn hơn, có thể ảnh hưởng đến tốc độ suy luận và mức sử dụng bộ nhớ, nên đây là một thành phần quan trọng của hạ tầng suy luận dài.
Nhóm nghiên cứu đã thử nghiệm trên nhiều dòng mô hình như Qwen2.5, Qwen3, Llama3.2 và Gemma3. Quy mô mô hình dao động từ 0,6B đến 14B, với các bộ tiêu chuẩn OpenBookQA, MMLU-Redux, ARC-Challenge và C-Eval.
Trong thử nghiệm, độ chính xác trung bình của C2C cao hơn 6,4-14,2% so với mô hình đơn lẻ. So với phương thức liên lạc giữa các mô hình dựa trên văn bản, độ chính xác cũng cải thiện 3,1-5,4%.
Độ trễ trung bình giảm 2,5 lần so với liên lạc bằng văn bản. Nhóm nghiên cứu giải thích rằng việc truyền trực tiếp biểu diễn nội bộ của mô hình, thay vì tạo văn bản giải thích trung gian, giúp giảm mất mát thông tin và độ trễ do quá trình tạo tuần tự.
Truyền trực tiếp trạng thái nội bộ của mô hình
Bài nghiên cứu cho rằng KV-cache có thể trở thành phương tiện truyền tải ngữ nghĩa giữa các mô hình, thay vì chỉ là vùng lưu trữ tạm thời phục vụ tính toán. Dù xử lý cùng một đầu vào, mỗi mô hình có cách tích lũy ngữ cảnh và biểu diễn kiến thức khác nhau. Việc kết hợp các biểu diễn này có thể bù đắp thông tin mà một mô hình đơn lẻ bỏ sót.
Tuy nhiên, cải thiện hiệu năng không được bảo đảm trong mọi tình huống. Nhóm nghiên cứu cho biết nếu mô hình Sharer truyền thông tin sai, mô hình Receiver có thể trả lời sai một vấn đề mà nó vốn có khả năng giải quyết chính xác khi hoạt động độc lập. Nhóm cũng phân tích rằng khả năng thất bại này có thể tăng khi kết nối một Sharer yếu với một Receiver mạnh.
Khả năng mở rộng vẫn là một thách thức. C2C hiện chủ yếu được thiết kế theo cấu trúc từng cặp, trong đó projector và fuser được huấn luyện riêng cho mỗi tổ hợp mô hình. Nếu nhiều mô hình cùng liên lạc, cần một phương pháp sử dụng không gian tiềm ẩn chung.
Phương pháp không gian tiềm ẩn thống nhất cho nhiều mô hình đã được đề xuất, nhưng bài nghiên cứu mới mô tả đây là hướng tiếp cận trong giai đoạn thử nghiệm ban đầu. Khi số lượng tổ hợp mô hình tăng lên, chi phí huấn luyện fuser và lỗi phát sinh trong quá trình liên lạc cũng cần được quản lý đồng thời.
Kết quả thử nghiệm được đo trên một GPU NVIDIA A100, với độ dài phản hồi giới hạn và các tổ hợp mô hình do nhóm nghiên cứu lựa chọn. Vì vậy, cần có thêm kiểm chứng trước khi khái quát hóa kết quả này sang chi phí, thông lượng, tính bảo mật và mức độ lan truyền lỗi trong môi trường dịch vụ thực tế.
Mã nguồn chính thức được công bố trên GitHub theo giấy phép Apache-2.0. Kho mã gồm các fuser được huấn luyện trước cho một số tổ hợp mô hình, cùng ví dụ huấn luyện và đánh giá. Tuy nhiên, C2C chưa được công bố như một tiêu chuẩn liên lạc phổ quát có thể áp dụng ngay cho mọi tổ hợp mô hình.
Nghiên cứu này có ý nghĩa ở việc nhóm nghiên cứu Trung Quốc đưa ra một phương pháp thay đổi cấu trúc liên lạc giữa các mô hình AI. Dù vậy, trong phạm vi nghiên cứu đã được xác nhận, chưa có thông tin về việc triển khai trong dịch vụ thương mại hoặc mối liên hệ trực tiếp với ngành tài sản số, blockchain hay bán dẫn.
Bình luận 0