Back to top
  • 공유 Chia sẻ
  • 인쇄 In
  • 글자크기 Cỡ chữ
URL đã được sao chép

DeepSeek công bố hạ tầng xử lý 3 triệu sandbox mỗi ngày

Thiết bị máy tính trong hộp cách ly trong suốt tại phòng thí nghiệm / TokenPost.ai (mono)

DeepSeek đã công bố DSec, hạ tầng sandbox phục vụ huấn luyện và đánh giá AI agent quy mô lớn. Một đơn vị triển khai trong môi trường sản xuất gồm khoảng 160 node và hỗ trợ khoảng 3 triệu sandbox mỗi ngày.

DeepSeek công bố bài nghiên cứu 'DeepSeek Elastic Compute (DSec): A Sandbox Infrastructure for Effective Agentic Training at Scale' trên arXiv ngày 19. Hơn 130 nhà nghiên cứu, trong đó có nhà sáng lập Lương Văn Phong (Liang Wenfeng), đứng tên tác giả. Nội dung này được xác nhận qua bài nghiên cứu và các thông tin liên quan.

Sandbox là môi trường thực thi biệt lập để mô hình AI kiểm tra kho mã, gọi công cụ hoặc chạy lệnh. AI agent không chỉ tạo câu trả lời mà còn kiểm tra kết quả thực thi và lặp lại tác vụ, nên cần môi trường có khả năng duy trì trạng thái.

Bài nghiên cứu cho biết quá trình huấn luyện và đánh giá agent quy mô lớn có thể tạo ra số lượng sandbox rất lớn trong thời gian ngắn, trong khi chức năng và mức độ cách ly cũng thay đổi theo từng tác vụ. Việc duy trì trạng thái trong các tương tác kéo dài và tải dữ liệu từ các kho ảnh quy mô lớn cũng được nêu là những thách thức chính.

DSec cung cấp bốn phương thức thực thi trong một SDK, gồm gọi hàm, container, microVM và máy ảo hoàn chỉnh. Thiết kế này cho phép lựa chọn môi trường thực thi theo chức năng và yêu cầu bảo mật của từng tác vụ.

Việc triển khai và vòng đời của từng sandbox được quản lý theo cụm. Hệ thống kết hợp nhiều lớp quản lý phiên bản môi trường, đồng thời áp dụng chia sẻ và thu hồi bộ nhớ cùng lập lịch CPU để quản lý tài nguyên thực thi.

Dữ liệu image của sandbox được tải khi cần từ 3FS, hệ thống tệp phân tán dành cho cụm của DeepSeek. Cách tiếp cận này nhằm giảm gánh nặng lưu trữ và quản lý lặp lại dữ liệu image trong quá trình vận hành nhiều môi trường thực thi khác nhau.

DSec được thiết kế cùng với một framework học tăng cường. Hệ thống tách biệt quá trình thực thi agent cần duy trì trạng thái khỏi quá trình huấn luyện GPU có thể tạm dừng, đồng thời thu hồi tài nguyên nhàn rỗi trong quá trình huấn luyện nhưng vẫn bảo toàn trạng thái thực thi.

Bài nghiên cứu cũng đề cập vấn đề 'reward hacking', trong đó agent đạt phần thưởng bằng cách khác với mục tiêu đặt ra. Việc thiết kế đồng thời môi trường thực thi agent và quản lý tài nguyên huấn luyện nhằm ứng phó với các vấn đề hành vi có thể phát sinh trong quá trình huấn luyện.

DeepSeek cho biết một đơn vị triển khai DSec trong môi trường sản xuất gồm khoảng 160 node và hỗ trợ khoảng 3 triệu sandbox mỗi ngày.

Số sandbox có thể chạy đồng thời vượt 380.000, trong khi tốc độ tạo sandbox vượt 5.000 sandbox mỗi giây. Sản lượng hằng ngày, quy mô chạy đồng thời và tốc độ tạo là các chỉ số khác nhau, nên không thể cộng gộp hoặc xem là cùng một thước đo hiệu năng.

Bài nghiên cứu nhận định một trình thực thi sandbox duy nhất khó đáp ứng các yêu cầu đa dạng của huấn luyện và đánh giá agent quy mô lớn. Điều kiện thực thi khác nhau từ tác vụ nhẹ như gọi hàm đến các tác vụ cần chức năng cấp hệ điều hành và mức độ cách ly cao.

DeepSeek trước đó đã mở rộng các công cụ dành cho nhà phát triển và môi trường thực thi agent. TokenPost từng đưa tin về các dấu hiệu phát triển liên quan đến harness. Việc công bố DSec cho thấy DeepSeek đang xây dựng hạ tầng riêng không chỉ cho mô hình AI mà còn cho môi trường nơi agent thực hiện tác vụ.

Tuy nhiên, bài nghiên cứu lần này không đề cập mối liên hệ trực tiếp với tài sản số hoặc dịch vụ blockchain. Nội dung cốt lõi được công bố tập trung vào việc đa dạng hóa môi trường thực thi cho huấn luyện AI agent và cấu trúc vận hành cụm.

<Bản quyền ⓒ TokenPost, nghiêm cấm sao chép và phân phối trái phép>

Phổ biến nhất

Các bài viết liên quan khác

Bình luận 0

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.

0/1000

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.
1