Cấu trúc hóa quy trình hoạt động của tác tử mô hình ngôn ngữ lớn (LLM) thành đồ thị có thể cải thiện hiệu suất trong các nhiệm vụ dài hạn. Nhóm nghiên cứu đánh giá 7 bộ tiêu chuẩn và 4 LLM, ghi nhận thành tích cao nhất hoặc đồng cao nhất ở 21 trong 24 tổ hợp mô hình và bộ tiêu chuẩn.
Nhóm nghiên cứu gồm Yuxing Lu, Yicheng Chen, Shanchan Wu và Sercan Ö. Arık đã công bố đề xuất “Procedural Graphs: A Self-Evolving Execution Structure for LLM Agents” trên arXiv ngày 8 tháng 9. Công trình có sự tham gia của các nhà nghiên cứu Google và giới học thuật, nhưng chưa có thông báo chính thức riêng từ Google về lịch thương mại hóa hay ứng dụng sản phẩm.
Đồ thị quy trình biểu diễn trình tự và điều kiện thực hiện nhiệm vụ dưới dạng “quy trình-quan hệ-quy trình”, tương tự cách đồ thị tri thức lưu trữ dữ kiện theo dạng “thực thể-quan hệ-thực thể”. Các nút thể hiện lệnh gọi công cụ, bước suy luận và trạng thái nhiệm vụ. Các liên kết ghi lại điều kiện chuyển tiếp, hướng dẫn thực thi và những lỗi cần tránh.
Trong quá trình thực hiện nhiệm vụ, tác tử xác định vị trí hiện tại trên đồ thị rồi truyền cấu trúc trong phạm vi hai bước lân cận tới mô hình guidance. Mô hình này chuyển thông tin thành hướng dẫn phù hợp với tình huống hiện tại và cung cấp cho solver, nhưng không bắt buộc hành động cuối cùng. Nhóm nghiên cứu cho biết phương pháp này được thiết kế để duy trì đồng thời khả năng suy luận tự do và kiểm soát theo quy trình.
Đồ thị tự điều chỉnh dựa trên kết quả thực thi. Bộ refiner dựa trên LLM so sánh các nhiệm vụ thành công và thất bại để tạo đề xuất thay đổi nút và liên kết. Những thay đổi chỉ được áp dụng khi hiệu suất được duy trì hoặc cải thiện trên một bộ xác thực riêng. Các đề xuất không được chấp nhận được lưu như bản ghi tiêu cực nhằm ngăn việc lặp lại cùng một thay đổi.
Cách tiếp cận này liên quan đến xu hướng cạnh tranh tác tử AI chuyển từ hiệu suất mô hình sang hệ thống doanh nghiệp, bởi mục tiêu là sắp xếp cấu trúc thực thi bên ngoài để giảm lỗi trong nhiệm vụ dài hạn thay vì huấn luyện lại chính mô hình.
Nhóm nghiên cứu đánh giá 7 bộ tiêu chuẩn gồm HotpotQA, MultiChallenge, GDPval, ALFWorld, τ-bench, BFCL v3 và EnterpriseArena, cùng 4 LLM gồm Claude Sonnet 4.6, Gemini 3.1 Pro, Gemini 3.5 Flash và Grok 4.1 Fast.
Đồ thị quy trình đạt thành tích cao nhất hoặc đồng cao nhất ở 21 trong 24 tổ hợp mô hình và bộ tiêu chuẩn. Tuy nhiên, mức cải thiện không đồng đều ở mọi nhiệm vụ và chênh lệch hiệu suất bị hạn chế trong một số bài toán hỏi đáp.
Trong EnterpriseArena, bộ tiêu chuẩn đánh giá nhiệm vụ dài hạn, tỷ lệ sống sót tổng thể của Gemini 3.1 Pro tăng từ 6% với phương pháp hiện có lên 34% khi áp dụng đồ thị, tương đương tăng 28 điểm phần trăm. EnterpriseArena mô phỏng việc tác tử thực hiện các quyết định tài chính doanh nghiệp trong thời gian dài, với thời gian từ 1 đến 6 tháng trước khi hoạt động huy động vốn được phản ánh thực tế và môi trường phải ứng phó với nhiều cuộc khủng hoảng kinh tế.
Trong môi trường này, kết quả không chỉ phụ thuộc vào khả năng trả lời từng câu hỏi mà còn phụ thuộc vào việc duy trì các quyết định trước đó và điều kiện nhiệm vụ trong thời gian dài. Đồ thị quy trình cấu trúc hóa quy trình và điều kiện của các bước trước để tác tử tham khảo khi lựa chọn hành động tiếp theo.
Trong thí nghiệm tự tiến hóa, tỷ lệ sống sót trên bộ xác thực tăng từ 0% lên 90%, còn tỷ lệ sống sót trên đồ thị cuối cùng được trả về trong bộ kiểm thử đạt 85%. Nhóm nghiên cứu lưu ý thí nghiệm dựa trên 20 tập dữ liệu cho mỗi phân đoạn, nên việc chấp nhận hoặc loại bỏ từng thay đổi có thể bị chi phối bởi chỉ một hoặc hai tập dữ liệu.
Các phản hồi công khai hiện chủ yếu đến từ ghi chú nghiên cứu độc lập và phần tóm tắt bài báo. Một số đánh giá cho rằng đồ thị quy trình giúp kiểm tra hành động tiếp theo dễ hơn so với nhật ký hội thoại hoặc bộ nhớ dạng văn bản đơn thuần. Ngược lại, cũng có ý kiến cho rằng việc tự động chấp nhận dựa trên bộ xác thực chưa đủ để bảo đảm các điều kiện trong đồ thị luôn đúng ở môi trường thực tế.
Chưa xác nhận được việc Google áp dụng công nghệ này vào sản phẩm chính thức, triển khai cho khách hàng doanh nghiệp hay ra mắt dịch vụ liên quan. Công trình cũng chưa đưa ra mối liên hệ trực tiếp với ngành tài sản số hoặc blockchain.
Nghiên cứu hiện dựa trên bản tiền xuất bản trên arXiv, chưa phải bài báo đã qua phản biện tại tạp chí học thuật hay kết quả tái lập từ một tổ chức độc lập. Vì vậy, kết quả nên được hiểu là bằng chứng cho thấy kiến thức quy trình có cấu trúc có thể hữu ích trong một số tổ hợp bộ tiêu chuẩn và mô hình cụ thể.
Quá trình tìm kiếm đồ thị và tạo hướng dẫn guidance cần thêm suy luận và sử dụng token. Ngay cả khi độ chính xác và tỷ lệ sống sót dài hạn tăng, chi phí vận hành và độ trễ cũng có thể tăng. Nguy cơ các chỉnh sửa sai trong đồ thị tích lũy theo thời gian cũng cần được kiểm chứng riêng.
Đồ thị quy trình được cho là có khả năng giảm bớt vấn đề thực thi dài hạn của tác tử LLM, nhưng khả năng tái lập trong môi trường dịch vụ thực tế và hiệu quả theo từng ngành vẫn là các vấn đề cần nghiên cứu thêm.
Bình luận 0