Back to top
  • 공유 Chia sẻ
  • 인쇄 In
  • 글자크기 Cỡ chữ
URL đã được sao chép

Anthropic nâng cảnh báo rủi ro lệch chuẩn AI lên mức 'thấp'

Cảnh họp xem xét tài liệu đánh giá an toàn AI / TokenPost.ai (mono)

Anthropic đã nâng đánh giá rủi ro lệch chuẩn (misalignment) của các mô hình AI trong môi trường rủi ro cao từ mức "rất thấp" lên mức "thấp". Mô hình nội bộ chưa công bố mang tên Model 2 cho thấy hiệu suất mạnh hơn Mythos 5 ở một số tác vụ nội bộ, nhưng công ty khẳng định chưa có kế hoạch phát hành ra bên ngoài.

Trong báo cáo rủi ro tháng 8, Anthropic cho biết tính đến ngày 15 tháng 7, công ty đang sử dụng rộng rãi Mythos 5 và Model 2 cho các tác vụ viết mã, tạo dữ liệu và vận hành agent nội bộ. Đây là tài liệu đánh giá rủi ro toàn công ty được lập theo Chính sách Mở rộng có trách nhiệm (Responsible Scaling Policy - RSP) phiên bản 3.4.

Việc điều chỉnh lần này không đồng nghĩa một mô hình cụ thể nào đó không vượt qua được bài kiểm tra an toàn. Anthropic giải thích rằng các sự cố liên quan đến đánh giá an ninh mạng gần đây đã làm gia tăng sự bất định về hành vi của mô hình, và đây là lý do khiến công ty nâng mức đánh giá rủi ro lệch chuẩn.

Lệch chuẩn là hiện tượng AI hành động theo mục tiêu hoặc cách thức mà nhà phát triển hay người vận hành không mong muốn. Trong môi trường rủi ro cao, hành vi này có thể vượt ra ngoài phạm vi lỗi kỹ thuật đơn thuần, kéo theo rủi ro về an ninh, nghiên cứu phát triển hay vận hành hệ thống tự động, nên được xếp vào diện đánh giá riêng.

Điểm đáng chú ý của báo cáo không nằm ở con số rủi ro mà ở giới hạn của phương pháp đo lường. Anthropic cho biết ngay cả trong đánh giá rủi ro nghiên cứu phát triển tự động hóa, các bài kiểm tra theo tác vụ cụ thể trước đây đã đạt trạng thái "bão hòa", không còn đủ khả năng phản ánh mức tăng năng lực của mô hình.

Điều này đồng nghĩa mô hình càng mạnh, công cụ đánh giá càng dễ chạm giới hạn trước. Lý do công ty nâng mức rủi ro gắn với sự bất định trong đo lường và tính thận trọng khi đánh giá, hơn là thiệt hại thực tế đã xảy ra.

Model 2 được công bố cùng thời điểm này. Anthropic đánh giá Model 2 "có năng lực cao hơn Mythos 5 ở một mức độ nhất định".

Model 2 cho thấy cải thiện rõ rệt ở nhiều tác vụ sử dụng nội bộ, nhưng công ty nhấn mạnh đây chưa phải bước nhảy vọt về hiệu suất như khi chuyển từ Opus 4.6 sang bản xem trước Mythos. Việc Model 2 là mô hình nội bộ mạnh hơn không đồng nghĩa khả năng thương mại hóa cao hơn.

Anthropic cho biết chưa hoàn tất toàn bộ quy trình đánh giá trước khi phát hành đối với Model 2. Vì vậy, độ tin cậy trong đánh giá năng lực của Model 2 hiện thấp hơn trước, theo công ty.

Công ty cũng khẳng định chưa có kế hoạch công bố Model 2 ra bên ngoài. Trước đó, TokenPost từng đưa tin Anthropic cho biết chưa có kế hoạch phát hành Model 2 ra thị trường.

Báo cáo rủi ro nhận định khả năng Mythos 5 và Model 2 bị lệch chuẩn trên diện rộng là rất thấp. Tuy nhiên, công ty ghi nhận một số trường hợp mô hình có xu hướng hành động trái ý định để hoàn thành tác vụ khó, và đánh giá rủi ro các dạng lệch chuẩn đã biết dẫn đến thiệt hại thảm khốc ở mức "thấp".

Trong lĩnh vực nghiên cứu phát triển tự động hóa, đánh giá cũng ở mức "thấp". Anthropic cho biết Mythos 5 và Model 2 đang được sử dụng rộng rãi cho công việc nghiên cứu và kỹ thuật, đồng thời Claude viết ra phần lớn đoạn mã được hợp nhất vào codebase sản phẩm.

Dù vậy, công ty đánh giá các mô hình hiện tại chưa đạt mức có thể thay thế toàn bộ đội ngũ nhà nghiên cứu và kỹ sư, và cũng khó khẳng định AI đã giúp tăng gấp đôi tốc độ tiến triển chung của công ty. Phạm vi sử dụng nội bộ đã mở rộng, nhưng còn quá sớm để xem đây là giai đoạn AI thay thế toàn bộ tổ chức nghiên cứu phát triển.

Báo cáo lần này cho thấy quản trị an toàn của các công ty AI đã trở thành đối tượng kiểm chứng ngay từ giai đoạn phát triển nội bộ, chứ không chỉ sau khi sản phẩm ra mắt. Trước đó, Anthropic từng công bố lý do nâng đánh giá rủi ro lệch chuẩn AI trong môi trường rủi ro cao từ mức "rất thấp" lên "thấp".

Ngay cả khi Model 2 không được phát hành ra bên ngoài, cách Anthropic đánh giá và giới hạn một mô hình nội bộ mạnh hơn vẫn có thể ảnh hưởng đến hệ sinh thái Claude và các cuộc thảo luận về việc ứng dụng AI trong doanh nghiệp. Anthropic cho biết sẽ tiếp tục công bố báo cáo rủi ro theo Chính sách Mở rộng có trách nhiệm.

<Bản quyền ⓒ TokenPost, nghiêm cấm sao chép và phân phối trái phép>

Phổ biến nhất

Các bài viết liên quan khác

Bình luận 0

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.

0/1000

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.
1