Back to top
  • 공유 Chia sẻ
  • 인쇄 In
  • 글자크기 Cỡ chữ
URL đã được sao chép

Nvidia(NVDA) kiểm chứng kỹ năng AI qua 947 lần thực thi thực tế

Thẻ đánh giá kỹ năng và bảng kiểm đặt cạnh laptop / TokenPost.ai

Nvidia(NVDA) đã đưa ra một phương pháp đánh giá kỹ năng (skill) dành cho AI agent, theo đó chất lượng cần được đo bằng kết quả thực thi thực tế thay vì chất lượng tài liệu mô tả. Công ty phân tích 145 kỹ năng thực tế và 947 trường hợp thực thi theo cặp để lượng hóa mức độ đóng góp của từng kỹ năng vào việc hoàn thành nhiệm vụ.

Nhóm nghiên cứu của Nvidia giới thiệu ACES (Agentic Continuous Evaluation of Skills) trong bài báo arXiv có tên "Evaluating Skills, Not Just Agents", công bố ngày 20 tháng 8. ACES thực thi cùng một nhiệm vụ trong hai điều kiện, bật kỹ năng và tắt kỹ năng, rồi đo chênh lệch kết quả bằng chỉ số gọi là "Skill Lift".

Theo bài báo, hệ số tương quan giữa điểm cấu trúc tĩnh và điểm giám định của LLM chỉ đạt Spearman ρ=0,14. Trong cùng điều kiện, Skill Lift tổng hợp trung bình là 0,2134, và tỷ lệ trường hợp cho lift dương chiếm 72,8%.

Skill Lift không phải là chỉ số hiệu năng tuyệt đối, mà thể hiện phần giá trị gia tăng ròng khi bật kỹ năng trong cùng điều kiện. Giá trị này có thể thay đổi tùy theo phân bố nhiệm vụ, mô hình, khung đánh giá (harness), không gian làm việc (workspace) và bộ chấm điểm (scorer) được sử dụng.

Điểm cốt lõi của nghiên cứu là xem kỹ năng không đơn thuần là tài liệu hướng dẫn, mà là một artifact có thể thực thi được của agent. Bài báo mô tả kỹ năng như một gói gồm tệp SKILL.md, script tùy chọn, tài liệu tham khảo và ví dụ minh họa.

Cấu trúc này dựa trên nguyên tắc progressive disclosure, nghĩa là agent chỉ đọc tài liệu liên quan khi cần. Khi danh mục kỹ năng (skill catalog) ngày càng lớn, việc chỉ tải đúng hướng dẫn cần thiết trở nên quan trọng hơn so với việc đọc toàn bộ hướng dẫn cùng lúc.

Các phương pháp kiểm tra trước đây có thế mạnh ở việc xác nhận định dạng tệp, frontmatter, cú pháp script và các mẫu bảo mật. Tuy nhiên, chúng khó xác định liệu agent có thực sự phát hiện ra kỹ năng, nhập đúng tham số, và hoàn thành nhiệm vụ đến cùng hay không.

ACES hướng đến việc lấp khoảng trống này bằng cách thực thi trực tiếp theo mô hình A/B. Thay vì chỉ xem kỹ năng có được trình bày gọn gàng trên tài liệu hay không, ACES quan sát toàn bộ quá trình từ phát hiện, gọi thực thi cho đến hoàn tất nhiệm vụ trong thực tế.

Blog kỹ thuật của Nvidia cũng giới thiệu SkillEvaluator như một công cụ đánh giá mã nguồn mở. Theo blog, Nvidia đã thực hiện đánh giá ba giai đoạn trên hơn 300 kỹ năng đã được xác minh (verified skills) và hơn 30 sản phẩm, ghi nhận mức cải thiện trung bình 31 điểm ở các tiêu chí Correctness, Discoverability, Effectiveness và Efficiency, và 39 điểm nếu không tính tiêu chí Security.

Con số này khác phạm vi với thử nghiệm 145 kỹ năng trong bài báo. Bài báo tập trung vào phương pháp luận ACES và Skill Lift, trong khi blog giới thiệu một thử nghiệm gần với benchmark trên danh mục sản phẩm thực tế hơn.

Tài liệu SkillEvaluator mô tả công cụ này là một framework đa tầng mã nguồn mở. Tier 1 là kiểm tra tĩnh, Tier 2 là kiểm tra trùng lặp và mức độ tương đồng, còn Tier 3 là đánh giá trực tiếp bằng agent thực tế.

Kho lưu trữ trên GitHub cũng cho biết SkillEvaluator bao gồm cổng kiểm soát chất lượng (quality gate), phát hiện trùng lặp về ngữ nghĩa, tạo dữ liệu đánh giá tổng hợp, và đánh giá agent trực tiếp. Điều này cho thấy việc kiểm định kỹ năng đang mở rộng vượt ra ngoài mức lint tài liệu, trở thành một bước trong pipeline triển khai.

Nvidia cũng nhắc đến các plugin dành cho Claude Code, Codex và Cursor trong blog của mình. Điều đó cho thấy nghiên cứu này không chỉ dừng ở đề xuất học thuật, mà đã kết nối với pipeline triển khai và kiểm định kỹ năng trong thực tế.

Xu hướng này cũng gắn liền với làn sóng mở rộng AI doanh nghiệp của Nvidia mà TokenPost từng đưa tin trước đó. Trong đó, AI doanh nghiệp không chỉ dừng lại ở bản thân mô hình mà mở rộng thành hạ tầng vận hành, bao gồm cả công cụ, kỹ năng và hệ thống đánh giá.

Dù vậy, rào cản triển khai vẫn còn. Tài liệu SkillEvaluator xếp mức hỗ trợ ở dạng Experimental, đồng thời nêu rõ đây là dự án dựa trên nỗ lực cộng đồng theo tinh thần best-effort và không có thỏa thuận mức dịch vụ (no SLA). Trong môi trường vận hành thực tế, khả năng tái lập kết quả, mức biến động giữa các lần thực thi và chi phí đánh giá vẫn cần được xem xét thêm.

Thông báo lần này không trực tiếp liên quan đến thị trường tiền mã hóa. Tuy nhiên, đây là thông tin đáng chú ý với những ai đang vận hành agent, toolchain và danh mục kỹ năng AI. Tiêu chuẩn đánh giá kỹ năng đang dịch chuyển, từ "tài liệu được viết tốt" sang "đơn vị thực thi thực sự hoàn thành công việc".

<Bản quyền ⓒ TokenPost, nghiêm cấm sao chép và phân phối trái phép>

Phổ biến nhất

Các bài viết liên quan khác

Bình luận 0

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.

0/1000

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.
1