Back to top
  • 공유 Chia sẻ
  • 인쇄 In
  • 글자크기 Cỡ chữ
URL đã được sao chép

AI agent doanh nghiệp: trọng tâm chuyển từ hiệu năng mô hình sang hệ thống vận hành

Màn hình laptop hiển thị quy trình phê duyệt nội bộ / TokenPost.ai

Trọng tâm cuộc đua AI agent đang dịch chuyển từ năng lực điều khiển máy tính sang việc xây dựng hệ thống vận hành đủ an toàn để đưa vào quy trình doanh nghiệp. Giới phân tích cho rằng chỉ hiệu năng mô hình thôi chưa đủ; doanh nghiệp cần thêm cơ chế quản lý ngữ cảnh, phân quyền, khôi phục lỗi và xác minh kết quả mới có thể giao việc thực tế cho AI agent.

Theo bài viết của Andreessen Horowitz (a16z) công bố ngày 28 tháng 8 năm 2025, các agent dạng "computer-use" (sử dụng máy tính trực tiếp) đang mở rộng phạm vi tự động hóa công việc bằng cách thao tác trực tiếp trên trình duyệt và môi trường desktop. a16z nhận định rằng trong môi trường doanh nghiệp, yếu tố quan trọng không chỉ nằm ở bản thân mô hình đa năng, mà còn ở khả năng thiết kế ngữ cảnh riêng cho từng công ty, độ tin cậy và năng lực điều phối (orchestration) cho các tác vụ kéo dài.

Agent dạng computer-use là hệ thống AI nhận diện màn hình mà con người đang sử dụng, sau đó tự thực hiện các thao tác như nhấp chuột, nhập liệu, chuyển màn hình. Khác với robot tự động hóa quy trình (RPA) truyền thống vốn chỉ lặp lại các bước cố định, loại agent này nhận mục tiêu, tự chọn công cụ cần dùng rồi xử lý nối tiếp nhiều bước.

Phạm vi ứng dụng trải rộng từ tìm kiếm tài liệu, nhập dữ liệu vào hệ thống quản lý khách hàng (CRM), gửi thông báo qua công cụ nhắn tin nội bộ, cho đến soạn báo cáo — những công việc phải di chuyển qua lại giữa nhiều phần mềm. Vì công việc doanh nghiệp luôn gắn với quyền truy cập, quy trình xử lý ngoại lệ, nhật ký kiểm toán và bước phê duyệt của con người, nên chỉ riêng khả năng thao tác màn hình không đủ để tự động hóa toàn bộ quy trình.

Theo công bố chính thức của nghiên cứu OSWorld, trong 369 tác vụ máy tính thực tế, tỷ lệ hoàn thành của con người đạt 72,36%, trong khi mô hình tốt nhất tại thời điểm đó chỉ đạt 12,24%. OSWorld là benchmark đo lường khả năng xử lý tệp, ứng dụng và trang web trong môi trường hệ điều hành thực tế.

OpenAI cho biết agent sử dụng máy tính (Computer-Using Agent - CUA), công bố ngày 23 tháng 1 năm 2025, đạt 38,1% trên OSWorld, 58,1% trên WebArena và 87% trên WebVoyager. Đây là con số cho thấy các mô hình thao tác máy tính trực tiếp đã vượt qua giai đoạn nghiên cứu để bước vào giai đoạn thương mại hóa sản phẩm.

Tuy nhiên, dù cùng đo khả năng sử dụng máy tính, nếu phiên bản benchmark, cách xây dựng tác vụ và hạ tầng thực thi (harness) khác nhau thì kết quả khó có thể so sánh trực tiếp. Bài báo gốc, phiên bản OSWorld-Verified và các lần đánh giá lại riêng của từng công ty đều áp dụng điều kiện khác nhau, nên mỗi con số hiệu năng cần đi kèm tiêu chuẩn đánh giá cụ thể.

Đây cũng là lý do khó dùng riêng điểm số mô hình để giải thích điểm nghẽn của AI agent doanh nghiệp. Dù sở hữu mô hình mạnh, nếu thiếu hệ thống cung cấp đúng ngữ cảnh, xác minh kết quả thực thi và khôi phục các tác vụ thất bại, doanh nghiệp vẫn khó vận hành ổn định trong môi trường sản xuất thực tế.

Microsoft(MSFT), trong bài viết công bố ngày 2 tháng 6, cho biết điều doanh nghiệp cần không chỉ là mô hình mạnh hay tài nguyên tính toán, mà là một hệ thống để xây dựng, triển khai, giám sát và kiểm soát agent. Hãng nêu bốn điều kiện chính để đưa agent vào môi trường sản xuất, gồm ngữ cảnh (context), quản trị (governance), khả năng quan sát (observability) và cải tiến liên tục.

OpenAI, trong bài viết công bố ngày 25 tháng 6, cũng cho biết cách sử dụng agent đang chuyển từ các truy vấn đơn lẻ sang việc giao phó những công việc kéo dài. Thời gian xử lý tác vụ càng dài, tầm quan trọng của việc xác minh kết quả trung gian, giới hạn quyền truy cập và quy trình chuyển giao lại cho con người khi thất bại càng tăng lên.

Bảo mật là bài toán khác mà agent doanh nghiệp phải giải quyết. Khi agent được phép đọc và ghi vào tài liệu nội bộ cùng hệ thống nghiệp vụ, khả năng tận dụng ngữ cảnh cần thiết tăng lên, nhưng rủi ro lộ thông tin nhạy cảm cũng tăng theo.

Nghiên cứu CI-Work của Microsoft Research đưa ra tỷ lệ vi phạm quyền riêng tư của các agent dùng mô hình ngôn ngữ lớn (LLM) trong doanh nghiệp ở mức 15,8-50,9%, và tỷ lệ rò rỉ thông tin lên tới 26,7%. Nhóm nghiên cứu kết luận rằng chỉ tăng quy mô mô hình hay độ sâu suy luận không thể giải quyết triệt để vấn đề rò rỉ thông tin theo ngữ cảnh.

Trong ngành hiện có hai luồng quan điểm trái chiều: một bên cho rằng agent thao tác qua màn hình và trình duyệt chỉ là giải pháp chuyển tiếp để kết nối với phần mềm hiện có, bên còn lại cho rằng cách agent tự thao tác công cụ như con người mới là xu hướng chủ đạo trong tương lai. Dù vậy, cả hai phía đều đồng ý rằng để triển khai thực tế, agent vẫn cần kiểm soát quyền truy cập, cơ chế bảo vệ (guardrail) và xác minh kết quả thực thi.

Trong nội bộ doanh nghiệp, các nỗ lực xây dựng cấu trúc vận hành agent vẫn đang tiếp diễn. Hệ thống AI nội bộ của Coinbase(COIN) đã áp dụng cấu trúc sandbox trên nền tảng đám mây, điều phối các sub-agent và tự động tạo tác vụ, và cấu trúc hệ thống này tạo nền tảng để phân định phạm vi thực thi và trách nhiệm khi mô hình xử lý công việc qua nhiều bước.

Trong lĩnh vực tài sản số, điểm tiếp xúc trực tiếp với AI agent không nằm ở lợi ích về giá mà nằm ở cách thiết kế danh tính, quyền hạn và hệ thống kiểm toán. Một nghiên cứu chung xác minh danh tính và phạm vi cho phép của các AI agent giao dịch tự động cũng đã được khởi động, cho thấy khi agent càng tham gia sâu vào nghiệp vụ doanh nghiệp và hạ tầng tài sản số, tầm quan trọng của hệ thống kiểm soát càng lớn.

Nguồn tham khảo: Andreessen Horowitz, OSWorld, OpenAI CUA, OpenAI Agents, Microsoft Blog, Microsoft Research

<Bản quyền ⓒ TokenPost, nghiêm cấm sao chép và phân phối trái phép>

Phổ biến nhất

Các bài viết liên quan khác

Bình luận 0

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.

0/1000

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.
1