Back to top
  • 공유 Chia sẻ
  • 인쇄 In
  • 글자크기 Cỡ chữ
URL đã được sao chép

6,12 tỷ yêu cầu LLM được công khai để nghiên cứu bộ nhớ đệm và định tuyến

Máy tính xách tay và thiết bị lưu trữ dùng để phân tích dữ liệu yêu cầu LLM / TokenPost.ai

Chutes và các nhà nghiên cứu Harvard đã công bố bộ dữ liệu gồm 6.122.413.756 yêu cầu mô hình ngôn ngữ lớn (LLM). Dữ liệu không chứa nội dung hội thoại thực tế mà chỉ cung cấp siêu dữ liệu phục vụ, qua đó cho phép phân tích cấu trúc bộ nhớ đệm và định tuyến của hạ tầng AI tạo sinh.

​​Nghiên cứu “A Year in LLM Serving: Workload Evolution, Caching and Load-Balancing” phân tích các yêu cầu phát sinh trên Chutes từ ngày 11 tháng 4 năm 2025 đến ngày 12 tháng 4 năm 2026. Dữ liệu bao gồm lịch sử yêu cầu của 9.174 mô hình và 314.970 người dùng đã được ẩn danh.

Kho lưu trữ công khai chứa thời điểm yêu cầu, mã định danh mô hình, người dùng và phiên bản phục vụ, số lượng token đầu vào và đầu ra, thời gian tạo token đầu tiên (TTFT) cùng số token được lưu trong bộ nhớ đệm. Bộ dữ liệu được cung cấp ở định dạng Parquet trên kho lưu trữ công khai.

Tổng dung lượng tệp khoảng 91GB, trong đó mỗi dòng tương ứng với một lần gọi API. Mã định danh người dùng được ẩn danh lại ba tháng một lần, còn prompt và phản hồi thực tế của mô hình bị loại khỏi phạm vi công khai.

Điểm được nhóm nghiên cứu chú ý là mức độ tập trung theo thời gian của các yêu cầu lặp lại. Trong số các yêu cầu mà cùng một người dùng gửi lại cho cùng một mô hình, 99% phát sinh trong vòng 15 phút sau yêu cầu trước đó.

Khi các yêu cầu của cùng một người dùng liên tiếp xuất hiện trong thời gian ngắn, hệ thống có thể tận dụng bộ nhớ đệm tiền tố (prefix cache) để tái sử dụng một phần đầu vào trước đó. Công nghệ này lưu trữ đầu vào đã xử lý, qua đó giảm phép tính tiền xử lý và rút ngắn thời gian tạo token đầu tiên.

Hiệu quả bộ nhớ đệm và cân bằng tải không vận động theo cùng một hướng. Việc gửi các yêu cầu liên quan đến cùng một phiên bản GPU có thể tăng tỷ lệ tái sử dụng bộ nhớ đệm nhưng cũng khiến yêu cầu dồn vào một phiên bản nhất định. Ngược lại, phân bổ yêu cầu cho nhiều phiên bản giúp chia đều tải hơn nhưng có thể khiến cùng một trạng thái bộ nhớ đệm bị sao chép ở nhiều nơi.

Nhóm nghiên cứu đưa ra cấu trúc trong đó định tuyến nhận biết bộ nhớ đệm có thể nâng tỷ lệ token được bộ nhớ đệm đáp ứng, nhưng phải chấp nhận một mức mất cân bằng tải nhất định. Định tuyến là quá trình quyết định gửi yêu cầu đến mô hình và phiên bản phục vụ nào, đồng thời phải cân nhắc cả khả năng tái sử dụng bộ nhớ đệm lẫn phân bổ tài nguyên GPU.

Dữ liệu cũng cho thấy hình thức sử dụng LLM đang thay đổi. Trong thời gian nghiên cứu, độ dài đầu vào nhìn chung ổn định, nhưng trung vị độ dài đầu ra đã giảm từ vài trăm token xuống dưới 100 token.

Nhóm nghiên cứu cho rằng các yêu cầu tự động ngắn và lặp lại có thể đang gia tăng so với hình thức hội thoại tương tác với câu trả lời dài. Tuy nhiên, nhóm cũng giải thích rằng chỉ dựa vào hồ sơ này không thể phân biệt hoàn toàn chủ thể của từng yêu cầu là con người hay phần mềm.

Tỷ trọng sử dụng giữa các mô hình cũng không cố định. Ở giai đoạn đầu, các mô hình thuộc dòng DeepSeek dẫn đầu lưu lượng, nhưng sau đó tỷ trọng sử dụng chuyển sang Qwen3-32B và DeepSeek-V3.2. Tỷ trọng lưu lượng của các mô hình ít phổ biến cũng tăng lên.

Nhóm nghiên cứu chỉ ra rằng rất khó ước tính công suất GPU hoặc nhu cầu mô hình dài hạn chỉ từ quan sát tại một thời điểm nhất định. Nói cách khác, không thể xem biến động sử dụng trên một nền tảng là tương đương với thay đổi nhu cầu của toàn bộ thị trường dịch vụ LLM.

Bộ dữ liệu này cũng có ý nghĩa vì Chutes là hạ tầng suy luận AI phi tập trung vận hành trên subnet 64 của Bittensor (TAO). Các nền tảng suy luận phi tập trung chia yêu cầu cho nhiều phiên bản để xử lý, còn dữ liệu lần này sử dụng luồng yêu cầu tích lũy trong môi trường vận hành thực tế làm đối tượng nghiên cứu.

Tuy nhiên, dữ liệu chỉ được thu thập từ một nền tảng suy luận phi tập trung. Vì vậy, dữ liệu không đại diện nguyên trạng cho toàn bộ thị trường LLM hay hành vi sử dụng dịch vụ AI tại Việt Nam. Tác động trực tiếp của việc công bố dữ liệu đối với giá TAO hoặc nhu cầu token cũng chưa được đưa ra.

Phạm vi ứng dụng của dữ liệu tập trung vào hiệu quả vận hành mô hình AI và nghiên cứu thiết kế hạ tầng. Điểm cốt lõi là có thể dùng hồ sơ yêu cầu thực tế để phân tích mối quan hệ giữa tỷ lệ tái sử dụng bộ nhớ đệm và việc phân bổ tải GPU.

Nhóm nghiên cứu đã công bố dữ liệu cho phép phân tích đồng thời mô hình yêu cầu, thay đổi trong việc sử dụng mô hình và độ trễ phục vụ. Do không bao gồm prompt và phản hồi, dữ liệu tập trung vào phương thức vận hành dịch vụ LLM và phân bổ tài nguyên hạ tầng hơn là nội dung hội thoại của người dùng.

Câu hỏi thường gặp

Q. Bộ dữ liệu có bao gồm nội dung hội thoại thực tế của người dùng không?

Không. Prompt và phản hồi của mô hình không được đưa vào dữ liệu. Chỉ các siêu dữ liệu phục vụ như thời gian yêu cầu, số lượng token, độ trễ và thông tin liên quan đến bộ nhớ đệm được công khai.

Q. Con số 99% có ý nghĩa gì?

Đây là kết quả nghiên cứu cho thấy trong các trường hợp cùng một người dùng gửi yêu cầu lặp lại đến cùng một mô hình, 99% yêu cầu phát sinh trong vòng 15 phút sau yêu cầu trước đó.

Q. Dữ liệu có liên quan trực tiếp đến Bittensor không?

Chutes là nền tảng suy luận vận hành trên subnet 64 của Bittensor. Tuy nhiên, chưa xác nhận được tác động trực tiếp của việc công bố bộ dữ liệu đối với giá TAO hoặc nhu cầu token.

<Bản quyền ⓒ TokenPost, nghiêm cấm sao chép và phân phối trái phép>

Phổ biến nhất

Các bài viết liên quan khác

Bình luận 0

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.

0/1000

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.
1