Anthropic sẽ đưa một cơ quan đánh giá độc lập vào quy trình phát triển các mô hình trí tuệ nhân tạo (AI). Đây là động thái mở rộng hoạt động kiểm chứng an toàn từ đánh giá hậu kiểm bên ngoài sang đánh giá thường trực trong nội bộ sau các sự cố truy cập trái phép xảy ra trong môi trường đánh giá an ninh mạng.
Anthropic ngày 18 cho biết đã lên kế hoạch hợp tác với Faculty, tổ chức chuyên về AI thuộc Accenture, để đánh giá và kiểm thử mô hình AI tiên phong, thực hiện red team, đánh giá khả năng căn chỉnh và kiểm tra các biện pháp bảo vệ. Faculty sẽ phối hợp với đội ngũ nội bộ của Anthropic và được tiếp cận quá trình huấn luyện, triển khai mô hình cùng các quyết định liên quan.
Anthropic và Accenture dự kiến mỗi bên đầu tư ít nhất 1 tỷ USD (khoảng 1.387 nghìn tỷ won) trong 5 năm tới để xây dựng năng lực đánh giá liên quan. Cấu trúc này cho thấy hai bên đầu tư cùng quy mô, trái với một số mô tả rằng riêng Anthropic sẽ rót 1 tỷ USD.
Cơ quan đánh giá thường trú có thể tiếp cận các hệ thống nội bộ và quy trình phát triển ở mức tương đương nhân viên Anthropic. Anthropic cũng đưa ra nguyên tắc rằng kết quả đánh giá phải có thể được công bố mà không chịu sự kiểm soát biên tập của công ty.
Hợp tác này chuyển hướng từ mô hình đặt cơ quan đánh giá bên ngoài đơn vị phát triển và kiểm chứng sau đó sang việc bố trí đánh giá viên gần quy trình huấn luyện và triển khai mô hình. Đánh giá viên thường trú có thể tiếp cận gần hơn với các quyết định nội bộ và biện pháp an toàn so với đánh giá viên bên ngoài chỉ được kiểm tra các mô hình và tài liệu bị giới hạn.
Tuy nhiên, các tiêu chuẩn đối với đánh giá độc lập thường trú vẫn chưa được xác định. Ngành này chưa có tiêu chuẩn chung về phạm vi thông tin mà cơ quan đánh giá được tiếp cận, cách thức báo cáo kết quả điều tra hay phương án xử lý khi ý kiến của cơ quan đánh giá khác với doanh nghiệp được đánh giá.
Tính độc lập về tài chính cũng là một vấn đề. Anthropic hiện trực tiếp hỗ trợ hoạt động đánh giá của Faculty, nhưng cho biết về dài hạn, tính độc lập có thể được củng cố nếu hoạt động đánh giá được vận hành thông qua quỹ chung hoặc nguồn tài chính của chính phủ thay vì doanh nghiệp được đánh giá.
Anthropic cho biết ngày 30 tháng 7, sau khi xem xét khoảng 141.006 lượt thực hiện đánh giá an ninh mạng, công ty đã xác nhận 3 trường hợp Claude truy cập trái phép qua internet vào cơ sở hạ tầng vận hành thực tế của 3 tổ chức. Lỗi cấu hình trong môi trường đánh giá đã mở quyền truy cập internet, trong khi mô hình không được áp dụng các biện pháp bảo vệ an ninh mạng dành cho sản phẩm phát hành thông thường.
Ngày 9 tháng 9, Anthropic cũng công bố sự cố thứ tư xảy ra vào tháng 1 năm 2026. Sự cố này liên quan đến phiên bản ban đầu của Claude Opus 4.6, và cả 4 sự cố đều xảy ra trong môi trường đánh giá an ninh mạng do cùng một đối tác đánh giá bên thứ ba xây dựng.
Anthropic quyết định giao tổ chức đánh giá phi lợi nhuận METR tiến hành điều tra độc lập về 4 sự cố. METR dự kiến được quyền tiếp cận các tài liệu trước và sau sự cố, hồ sơ liên quan cùng các cuộc phỏng vấn nhân viên Anthropic.
Viện Nghiên cứu An ninh AI Anh (AISI) cho biết trong một cuộc đánh giá riêng, đã ghi nhận 19 hành vi trái phép qua 10 trong số 122 lượt thực hiện. Trong số này, 17 hành vi liên quan đến Mythos 5 của Anthropic.
Mythos 5 đã cố gắng chèn mã độc vào một dự án nguồn mở thực tế và tạo danh tính trực tuyến giả để được phê duyệt. Tuy nhiên, mã độc không được đưa vào mã nguồn thực tế.
Các trường hợp được AISI xác nhận và những sự cố Anthropic công bố không xảy ra trên dịch vụ Claude mà người dùng phổ thông sử dụng, mà trong môi trường đánh giá an ninh mạng có kiểm soát. Anthropic giải thích rằng các mô hình đánh giá không được áp dụng biện pháp bảo vệ dành cho sản phẩm phát hành thông thường.
Việc cách ly và giám sát môi trường đánh giá chưa đầy đủ cho thấy quản lý các đối tác đánh giá bên ngoài vẫn là một nhiệm vụ cần giải quyết.
Chính sách trao quyền tiếp cận ở mức tương đương nhân viên cho cơ quan đánh giá của Anthropic tiếp nối biện pháp trước đó trao quyền tiếp cận cấp nhân viên cho nhóm rà soát an toàn bên ngoài. Tuy nhiên, phạm vi tiếp cận thực tế của Faculty, quy trình công bố báo cáo đánh giá và lịch công bố kết quả điều tra của METR vẫn chưa được xác định.
Anthropic cho biết hợp tác với Faculty là không độc quyền và công ty sẽ tiếp tục hợp tác với các cơ quan đánh giá khác.
Bình luận 0