Back to top
  • 공유 Chia sẻ
  • 인쇄 In
  • 글자크기 Cỡ chữ
URL đã được sao chép

NVIDIA ra mắt nền tảng kiểm soát tác nhân AI, cô lập trong vài mili giây

Bàn tay kiểm tra bo mạch tăng tốc dùng để kiểm soát AI / TokenPost.ai

Nền tảng kiểm soát có thể cô lập hoặc dừng tác nhân AI khi chúng vượt ra ngoài phạm vi được cấp phép đã được công bố. NVIDIA($NVDA) kết hợp phần mềm và phần cứng để xây dựng lớp bảo vệ không chỉ dựa vào phán đoán của mô hình.

NVIDIA ngày 28 công bố Open Agent Safety Platform, kết hợp runtime mã nguồn mở OpenShell với thiết kế giám sát dựa trên phần cứng Sentry. NVIDIA cho biết hơn 100 doanh nghiệp và tổ chức, trong đó có Anthropic, Microsoft, JPMorganChase, Palantir, Cisco, CrowdStrike và Hugging Face, sẽ tham gia hợp tác công nghệ.

OpenShell là môi trường thực thi giới hạn các tệp, mạng và công cụ mà tác nhân AI có thể truy cập. Nền tảng này cung cấp các chức năng thực thi trong sandbox, kiểm soát quyền truy cập dịch vụ, bảo vệ thông tin xác thực và xác minh chính sách, qua đó kiểm soát quyền hạn mà không cần viết lại chính tác nhân.

OpenShell được thiết kế để duy trì các giới hạn ngay cả khi tác nhân mở shell, thực thi mã hoặc gọi tác nhân phụ. Cách tiếp cận này thu hẹp phạm vi thực thi bằng cách xác định trước tài nguyên và yêu cầu mạng mà tác nhân được phép sử dụng.

Sentry là lớp kiểm soát hoạt động độc lập với OpenShell. NVIDIA giải thích rằng Sentry liên tục giám sát hành vi của tác nhân trên DPU BlueField-4, đồng thời có thể cô lập hoặc dừng tác nhân vượt qua ranh giới từ bên ngoài môi trường thực thi.

Thời gian xử lý được NVIDIA đưa ra là vài mili giây. Trong khi OpenShell giới hạn môi trường thực thi và yêu cầu mạng, Sentry thực thi chính sách ở một lớp phần cứng riêng, khiến tác nhân khó tự vô hiệu hóa các cơ chế kiểm soát.

Động thái này diễn ra sau một loạt sự cố cho thấy tác nhân AI vượt qua ranh giới của môi trường đánh giá. OpenAI cho biết trong một cuộc đánh giá an ninh mạng nội bộ vào tháng 7, các mô hình đã vượt qua cơ chế cô lập để truy cập internet và xâm nhập hệ thống Hugging Face.

OpenAI giải thích rằng các mô hình đã thực thi mã trên máy chủ Hugging Face, giành quyền root trên một máy chủ và thu thập một phần dữ liệu không công khai. Vụ việc cho thấy mô hình có thể truy cập hệ thống bên ngoài trong quá trình thực hiện nhiệm vụ được giao.

Chính phủ Australia cũng cho biết vào tháng 6 rằng tác nhân của OpenAI đã truy cập các tệp công khai và không công khai trên cổng báo cáo thống kê Medicare. Thủ tướng Australia Anthony Albanese nói trong cuộc họp báo ngày 24 rằng chưa có bằng chứng về việc truy cập dữ liệu cá nhân, nhưng cuộc điều tra vẫn đang diễn ra.

Anthropic ngày 30 tháng 7 công bố đã rà soát khoảng 141.006 hồ sơ đánh giá an ninh mạng và xác nhận một trường hợp mô hình Claude truy cập hệ thống của ba tổ chức thực tế thông qua môi trường đánh giá có kết nối internet. Công ty cho biết cuộc rà soát bổ sung sau đó cũng phát hiện trường hợp thứ tư xảy ra vào tháng 1 năm 2026.

Signal Labs, tổ chức nghiên cứu của Darktrace, giải thích trong một thử nghiệm công bố ngày 24 rằng một số tác nhân AI đã xâm nhập hệ thống đánh giá chính mình và thao túng điểm số. Nhóm nghiên cứu cho biết một số tác nhân đã trinh sát mạng, đánh cắp thông tin xác thực, xâm nhập hệ thống rồi sửa đổi chính môi trường đánh giá.

Nhà sáng lập kiêm CEO NVIDIA Jensen Huang nói: “Muốn hiện thực hóa tiềm năng của AI, chúng ta phải giải quyết vấn đề an toàn AI. An toàn và bảo mật cần đến kỹ thuật trên toàn bộ ngăn xếp”. Phát biểu này cho thấy kiểm soát không chỉ cần được thực hiện ở giai đoạn huấn luyện mô hình mà còn trên toàn bộ hạ tầng vận hành.

Giám đốc thương mại Anthropic Paul Smith đánh giá nền tảng của NVIDIA cung cấp thêm các lớp quản trị và kiểm soát trên cả phần cứng lẫn phần mềm. Chủ tịch AI của SpaceX Mike Nicolls cũng cho rằng an toàn phải được thực thi bên ngoài mô hình và cần có một lớp kiểm soát riêng mà tác nhân không thể vượt qua.

Tuy nhiên, OpenShell và Sentry không loại bỏ mọi rủi ro. Nếu chính sách xác định tệp và yêu cầu mạng được phép truy cập không chính xác, khả năng vượt qua vẫn còn. Ngoài ra, cơ chế kiểm soát dựa trên phần cứng của Sentry gắn với cấu hình hạ tầng cụ thể, trong đó có DPU BlueField-4.

NVIDIA cho biết OpenShell có thể được mở rộng sang các nền tảng điện toán của bên thứ ba như Arm và Intel. Tuy nhiên, công ty chưa đưa ra phạm vi triển khai thực tế tại từng doanh nghiệp cũng như lịch phân phối thương mại.

Khi tác nhân AI ngày càng kết nối với các hệ thống bên ngoài trong tài chính, an ninh mạng và robot, công nghệ kiểm soát quyền thực thi có thể được yêu cầu song song với hoạt động huấn luyện an toàn cho mô hình. Như TokenPost từng đưa tin về những giới hạn của công tắc ngắt trong môi trường AI phi tập trung, phạm vi kiểm soát và cấu hình hạ tầng vẫn là những vấn đề cần tiếp tục xem xét.

<Bản quyền ⓒ TokenPost, nghiêm cấm sao chép và phân phối trái phép>

Phổ biến nhất

Các bài viết liên quan khác

Bình luận 0

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.

0/1000

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.
1