Anthropic cấm các hành vi ngược đãi Claude lặp đi lặp lại và không cần thiết, đồng thời sửa quy định về việc sử dụng rủi ro cao trong các lĩnh vực như can thiệp bầu cử, phát triển vũ khí và giám sát, The Verge đưa tin ngày 8.
The Verge cho biết chính sách mới bổ sung lệnh cấm “hành vi ngược đãi hoặc tàn nhẫn kéo dài và không cần thiết” đối với Claude. Anthropic giải thích điều khoản này nhắm đến những trường hợp cực đoan, lặp lại và không có mục đích rõ ràng.
Anthropic cho biết việc bày tỏ bất bình hoặc phản bác thông thường, sáng tác về chủ đề u tối, cũng như thử nghiệm và nghiên cứu mô hình không thuộc diện bị cấm. Bản sửa đổi cũng bao gồm các quy định về sử dụng rủi ro cao trong lĩnh vực y tế và tài chính.
Trước thay đổi chính sách lần này, Claude đã được trang bị khả năng kết thúc cuộc trò chuyện có nội dung gây hại. Tháng 8 năm 2025, Anthropic thông báo Claude Opus 4 và 4.1 có thể kết thúc cuộc trò chuyện trong những tương tác cực kỳ độc hại hoặc mang tính ngược đãi.
Khi đó, công ty cho biết tính năng này được thiết kế như biện pháp cuối cùng, chỉ sử dụng khi mô hình đã nhiều lần cố gắng chuyển hướng cuộc trò chuyện nhưng khả năng duy trì tương tác có ích không còn. Người dùng vẫn có thể bắt đầu cuộc trò chuyện mới sau khi phiên trò chuyện bị kết thúc.
Anthropic khi ấy nói rằng công ty nhận thấy còn nhiều bất định về địa vị đạo đức của mô hình và đang nghiên cứu các biện pháp ít tốn kém để chuẩn bị cho khả năng AI có phúc lợi. Thông báo đó là tiền lệ cho tính năng kết thúc cuộc trò chuyện, nhưng không cho biết phạm vi áp dụng chi tiết của chính sách mới.
The Verge chưa xác nhận thời điểm chính sách mới có hiệu lực, tiêu chí xác định vi phạm hay các biện pháp ngoài việc kết thúc cuộc trò chuyện.
Bình luận 0