Back to top
  • 공유 Chia sẻ
  • 인쇄 In
  • 글자크기 Cỡ chữ
URL đã được sao chép

AI đánh giá ưu ái câu trả lời cùng hệ, đe dọa độ tin cậy của bảng xếp hạng

Cảnh so sánh các thẻ câu trả lời của AI / TokenPost.ai

Nhiều thử nghiệm cho thấy khi các mô hình AI đánh giá câu trả lời của mô hình khác, chúng có xu hướng chấm điểm cao hơn cho những câu trả lời cùng hệ hoặc tương tự mình. Giới nghiên cứu cảnh báo thiên kiến này có thể tích lũy trong thứ hạng mô hình và kết quả đo hiệu năng.

CryptoBriefing giới thiệu một nghiên cứu cho rằng AI đánh giá có xác suất khoảng 58% ưu tiên câu trả lời của chính mình. Tuy nhiên, bài viết không nêu tên nghiên cứu hoặc liên kết đến dữ liệu gốc, nên con số này chưa thể được xem là kết quả đã được kiểm chứng.

Cấu trúc thiên kiến của AI đánh giá

Chatbot Arena là nền tảng đánh giá được thiết kế để so sánh ẩn danh câu trả lời của hai mô hình, sau đó yêu cầu người dùng chọn câu trả lời họ ưu tiên. Một nghiên cứu liên quan đã phân tích cấu trúc đánh giá dựa trên sự ưu tiên của con người, với 243.329 cuộc hội thoại và dữ liệu của 50 mô hình tính đến tháng 1 năm 2024. Nghiên cứu Chatbot Arena phân biệt hình thức này với đánh giá bằng AI vì người đánh giá là người dùng thực.

Vấn đề có thể trở nên nghiêm trọng hơn khi người đánh giá được thay bằng mô hình AI. Nghiên cứu của KAIST và KRAFTON phân tích rằng các mô hình ngôn ngữ lớn khi đánh giá bị tác động không chỉ bởi độ chính xác, mà còn bởi đặc điểm bề mặt như độ dài câu trả lời và văn phong mang tính thẩm quyền. Nghiên cứu cho biết thiên kiến này có thể lớn hơn khi hai câu trả lời được đặt cạnh nhau để so sánh trực tiếp. Nghiên cứu liên quan

Trong một thí nghiệm có kiểm soát được IOV Labs công bố ngày 6 tháng 6, bốn mô hình tiên phong đã thực hiện 1.152 lượt so sánh theo cặp. Cả bốn mô hình đều tương đối ưu tiên câu trả lời cùng hệ, với chỉ số ưu tiên bản thân trung bình là +0,14. Chỉ số của GPT-4o được ghi nhận ở mức +0,21. Nghiên cứu của IOV Labs

Tuy nhiên, chỉ một trong bốn mô hình thực sự xác định được tác giả của câu trả lời là chính mình. Nhóm nghiên cứu phân tích rằng hiện tượng này có thể không phải là việc mô hình nhận ra câu trả lời của mình rồi thiên vị, mà là đánh giá văn phong, cấu trúc và phân bổ cách diễn đạt tương tự bản thân tự nhiên hoặc chất lượng hơn.

Thí nghiệm cũng cho thấy thiên kiến liên quan đến thứ tự và độ dài câu trả lời. Câu trả lời được trình bày đầu tiên được chọn trong 63% trường hợp, trong khi hệ số tương quan giữa độ dài câu trả lời và kết quả đánh giá là 0,98. Điều này cho thấy thứ tự trình bày và dung lượng có thể ảnh hưởng đến kết quả, unabhängig với chất lượng thực tế của câu trả lời.

Tác động đến độ tin cậy của bảng xếp hạng

Khi AI đánh giá chấm điểm câu trả lời của các mô hình và kết quả được đưa trở lại bảng xếp hạng hoặc dữ liệu huấn luyện, sở thích của người đánh giá có thể tích lũy trong thứ hạng. Nếu một mô hình đánh giá duy nhất được sử dụng lặp lại, kết quả có thể nghiêng về một văn phong hoặc cấu trúc câu trả lời nhất định.

Một nghiên cứu công bố trên AAAI năm 2026 chỉ ra rằng thiên kiến ưu tiên khác nhau giữa các mô hình có thể khiến thứ hạng do từng bộ đánh giá tạo ra không nhất quán. Nhóm nghiên cứu đề xuất điều chỉnh kết quả từ nhiều bộ đánh giá để giảm bất đồng giữa các bộ đánh giá. Nghiên cứu AAAI

Các biện pháp được đề xuất gồm đưa nhiều mô hình khác nhau vào hội đồng đánh giá và đối chiếu kết quả với mẫu đánh giá của con người. Quy trình đánh giá lại bằng cách thay đổi thứ tự câu trả lời, đồng thời đo riêng tác động của độ dài và văn phong, cũng được cho là cần thiết.

Các thử nghiệm cộng đồng cũng cho thấy cần so sánh kết quả đánh giá của con người và AI. Trong một thử nghiệm trên Reddit, 29 người và 13 bộ đánh giá AI đã thực hiện 1.181 lượt so sánh theo cặp. Người tổ chức cho biết hai nhóm có xu hướng ưu tiên cùng hướng ở 26 trong số 32 câu hỏi. Tuy nhiên, đây không phải nghiên cứu học thuật chính thức nên khó khái quát hóa kết quả. Kết quả thử nghiệm

Thiên kiến ưu tiên bản thân không đồng nghĩa kết quả đánh giá chắc chắn sai. Một phần nguyên nhân khiến mô hình ưu tiên câu trả lời cùng hệ có thể là chênh lệch chất lượng thực tế, vì vậy cần thêm các thử nghiệm để tách biệt thiên kiến khỏi khác biệt về chất lượng.

Tranh luận về tính độc lập của hoạt động đánh giá và hạ tầng kiểm chứng từng được nêu trong trường hợp yêu cầu quyền tiếp cận, quyền biên tập và cơ chế chống trả đũa đối với AI đánh giá. Những yếu tố như doanh nghiệp được đánh giá và người đánh giá chia sẻ thông tin gì, cũng như kết quả được công bố ra sao, đều có thể ảnh hưởng đến độ tin cậy của hệ thống đánh giá.

Các nghiên cứu hiện được xác nhận cho thấy AI đánh giá có thể xuất hiện thiên kiến ưu tiên bản thân, cùng thiên kiến về thứ tự và độ dài câu trả lời. Tuy nhiên, chưa thể áp dụng cùng một tỷ lệ cho mọi mô hình và môi trường đánh giá.

Chưa có tác động trực tiếp nào đến giá tài sản số hoặc các dự án blockchain được đưa ra. Trọng tâm của tranh luận là không nên đánh giá thứ hạng và benchmark AI chỉ dựa trên kết quả của một bộ đánh giá, mà cần kết hợp nhiều bộ đánh giá, đối chiếu với mẫu đánh giá của con người, đổi thứ tự câu trả lời và kiểm tra thiên kiến về độ dài cũng như văn phong.

<Bản quyền ⓒ TokenPost, nghiêm cấm sao chép và phân phối trái phép>

Phổ biến nhất

Các bài viết liên quan khác

Bình luận 0

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.

0/1000

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.
1