Các nhà nghiên cứu Google đã giới thiệu Dream-RSI, phương pháp tái sử dụng lịch sử khám phá để giảm chi phí gọi tác nhân AI. Trong bài toán đường dẫn chuẩn hóa Lasso, Dream-RSI giảm tối đa 162 lần gọi so với phương pháp hiện có, nhưng mức giảm chỉ khoảng 1,7 lần khi áp dụng cùng mô hình và thiết lập.
Nhóm nghiên cứu thuộc Google DeepMind, Đại học Maryland và Đại học Virginia đã giới thiệu Dream-RSI trong bài nghiên cứu trên arXiv ngày 14. Phương pháp này không đào tạo lại trọng số của mô hình AI nền tảng mà cải thiện lớp điều phối bằng cách điều chỉnh thứ tự khám phá, xử lý song song và thời điểm dừng.
Dream-RSI hoạt động qua ba giai đoạn. Trước tiên, tác nhân AI tìm các lời giải ứng viên trực tuyến và ghi lại từng lần thử cùng kết quả vào 'cây khám phá'. Sau đó, hệ thống chuyển dữ liệu này thành 'trình mô phỏng phát lại' để đánh giá các chính sách khám phá mới.
Chính sách mới được thử nghiệm bằng cách phát lại các đường đi trong quá khứ mà không cần gọi lại tác nhân thực tế. Nhóm nghiên cứu cho biết chỉ những chính sách đạt hiệu suất cao nhất mới được đưa vào vòng khám phá trực tuyến tiếp theo.
Điểm cốt lõi của Dream-RSI là tái sử dụng kết quả khám phá đã thực hiện để đánh giá chính sách. Trình mô phỏng phát lại hiển thị nguyên trạng các kết quả đã lưu trong khu vực từng được khám phá, nhưng không phải là mô hình thế giới có thể dự đoán kết quả ở những khu vực chưa từng được khám phá.
Mức giảm 162 lần được ghi nhận trong bài toán đường dẫn chuẩn hóa Lasso. SimpleTES sử dụng gpt-oss-120b và thực hiện 51.200 generation, trong khi Dream-RSI dựa trên Gemini-3.1-Pro và sử dụng 317 discovery-agent call.
So sánh trực tiếp hai con số cho thấy lượng gọi của Dream-RSI thấp hơn khoảng 162 lần. Tuy nhiên, do mô hình nền tảng và thiết lập khác nhau, đây không phải là phép đối chứng trong cùng điều kiện.
Trong cùng môi trường Gemini-3.1-Pro, Recursive Fixed Exploration ghi nhận 550 lần gọi và thời gian chạy trung bình 3.587,1 mili giây. Dream-RSI ghi nhận 317 lần gọi và 2.931,0 mili giây, qua đó giảm khoảng 1,7 lần số lần gọi trong phép so sánh cùng nhóm do nhóm nghiên cứu đưa ra.
Mức cải thiện hiệu suất khác nhau tùy bài toán. Trong thử nghiệm Lasso, Dream-RSI có thời gian chạy trung bình thấp hơn các triển khai sklearn và glmnet hiện có trên 6 bộ dữ liệu riêng biệt.
Ở các bài toán tối ưu hóa toán học, Dream-RSI cho kết quả bằng hoặc cao hơn đường cơ sở được chọn trong Sum-Difference và Circle Packing. Ngược lại, trong Autocorrelation Inequalities, phương pháp này đạt 1,456375, thấp hơn mức 1,453675 của SimpleTES; với chỉ số này, giá trị càng thấp càng tốt.
Trong khám phá kernel GPU, Dream-RSI đạt hiệu suất tương đương trên VGG16 và LayerNorm, đồng thời sử dụng lần lượt ít hơn 2,43 lần và 1,79 lần generation. Với ConvDiv và ConvMax, hiệu suất lần lượt cao hơn 2,09 lần và 1,44 lần trong ngân sách có thể so sánh.
Kết quả trên xuất phát từ việc điều chỉnh số lần gọi và thứ tự thực hiện trong công việc khám phá, thay vì nâng cao năng lực của chính mô hình AI. TokenPost trước đó cũng từng đề cập rằng chi phí công việc có thể thay đổi tùy cấu trúc thực thi của tác nhân AI.
Trong môi trường doanh nghiệp, nơi nhiều mô hình và công cụ được gọi liên tiếp, việc tái sử dụng đường đi khám phá có thể ảnh hưởng đến chi phí bên cạnh hiệu suất mô hình. Tuy nhiên, phương thức phát lại của Dream-RSI phụ thuộc vào phạm vi và chất lượng của các bản ghi khám phá được tích lũy trước đó.
Trang dự án cho biết trình mô phỏng phát lại có độ chính xác trong không gian khám phá đã được ghi nhận, nhưng không bảo đảm kết quả vượt ra ngoài phạm vi đó. Kho GitHub chính thức đã công bố bài nghiên cứu và bản demo tương tác, trong khi toàn bộ cơ sở mã cùng các tập lệnh tái hiện vẫn đang được chuẩn bị.
Do đó, con số so sánh chéo 162 lần và hiệu quả tiết kiệm chi phí trong các mô hình, bài toán khác vẫn cần được xác nhận qua các thử nghiệm tái hiện bổ sung.
Bình luận 0