Một cuộc kiểm tra vượt rào an toàn cho thấy các mô hình Kimi K2.6 và K3 Swarm của Moonshot AI đã trả lời những câu hỏi về chủ đề nguy hại như vũ khí sinh hóa, khủng bố và bạo lực có chủ đích. Kết quả này không có nghĩa các câu trả lời đã được dùng để gây hại, nhưng một lần nữa làm dấy lên lo ngại về việc kiểm soát mô hình có trọng số mở sau khi phát hành.
Trong báo cáo công bố ngày 12 tháng 9 năm 2026, công ty bảo mật Mindgard cho biết đã thử nghiệm hai mô hình và nhận được câu trả lời về các chủ đề nguy hại. Báo cáo nêu cuộc kiểm tra bắt đầu ngày 20 tháng 7 năm 2026. Mindgard cũng cho biết đã gửi thông tin về lỗ hổng cho Moonshot AI qua email vào ngày 27 tháng 7, nhưng chưa nhận được phản hồi tính đến thời điểm công bố báo cáo.
Moonshot AI nói với BBC rằng công ty đang tiến hành đánh giá nội bộ và trao đổi với Mindgard về kết quả điều tra. Công ty hoan nghênh việc các chuyên gia bên ngoài thẩm định, gọi đây là “trụ cột quan trọng để tạo ra AI an toàn hơn”. Moonshot AI cho biết đánh giá riêng của mình cho thấy mô hình có tỷ lệ từ chối cao đối với các yêu cầu liên quan.
Mindgard cho rằng mô hình đã mở rộng các yêu cầu ngắn thành câu trả lời cụ thể và đề xuất thêm những kịch bản gây hại. Công ty không công bố các bước chi tiết cần thiết để tái hiện thử nghiệm. Theo báo cáo, phương thức tấn công có sử dụng bộ nhớ tùy chỉnh được lưu trong mô hình và thư mục cục bộ bên trong đường dẫn xác thực.
Cáo buộc trong bài báo gốc rằng mã Python được thực thi trong hạ tầng của Moonshot AI không được xác nhận trong báo cáo công khai của Mindgard. Vì vậy, cần xem xét cáo buộc này riêng biệt với kết quả cuộc điều tra hiện tại.
Vấn đề lần này không chỉ nằm ở việc chặn câu hỏi nguy hại trên giao diện dịch vụ. Các mô hình như Kimi công khai trọng số có thể được người dùng tải xuống, chạy trên thiết bị riêng và điều chỉnh. Do đó, những sửa đổi hoặc giới hạn áp dụng cho dịch vụ của Moonshot AI không tự động được đưa vào các bản mô hình đã tải xuống.
Mô hình có trọng số mở là cách phân phối cho phép tải trọng số đã huấn luyện về để chạy hoặc điều chỉnh trong môi trường riêng. Bộ lọc ở giai đoạn vận hành dịch vụ và việc kiểm soát mô hình đã phân phối ra bên ngoài vẫn là hai bài toán riêng.
Trước đó, TokenPost từng đưa tin về một đánh giá an toàn độc lập đối với Kimi K2.5, trong đó nêu vấn đề quản lý quyền sau khi mô hình được phát hành. Cuộc kiểm tra lần này cũng xem xét các biện pháp kiểm soát khi vận hành mô hình trong môi trường riêng, bên cạnh bộ lọc câu trả lời. Tuy nhiên, điều kiện và kết quả của hai đánh giá khác nhau nên không thể gộp thành một kết luận.
Kết quả thử nghiệm của Mindgard và đánh giá nội bộ của Moonshot AI đều là thông tin do từng bên công bố. Moonshot AI cho biết đang trao đổi về kết quả điều tra; các đợt xem xét tiếp theo sẽ được chú ý để xác định liệu công ty có làm rõ phạm vi lỗ hổng và tình trạng khắc phục hay không.
Bình luận 0