Back to top
  • 공유 Chia sẻ
  • 인쇄 In
  • 글자크기 Cỡ chữ
URL đã được sao chép

Motif Technologies đứng đầu benchmark nhưng vẫn bị loại ở vòng 2 dự án mô hình nền tảng AI độc lập Hàn Quốc

Hiện trường họp báo của chính phủ với bảng điểm đánh giá / TokenPost.ai

Motif Technologies, công ty đạt điểm benchmark tổng cao nhất trong dự án mô hình nền tảng AI độc lập của chính phủ Hàn Quốc, đã bị loại ở vòng đánh giá thứ hai. Điểm tổng chung cuộc lần lượt là SK Telecom 70,6 điểm, Upstage 69,9 điểm, Viện nghiên cứu AI của LG (LG AI Research) 69,0 điểm và Motif Technologies 65,8 điểm.

Bộ Khoa học và Công nghệ Thông tin Truyền thông Hàn Quốc (MSIT) công bố điểm chi tiết vòng đánh giá thứ hai của dự án mô hình nền tảng AI độc lập trong tài liệu tham khảo báo chí ngày 27. Ba đội đứng đầu được chọn vào vòng tiếp theo, còn Motif Technologies xếp thứ tư và bị loại.

Vòng đánh giá thứ hai có tổng thang điểm 100, gồm benchmark 40 điểm, đánh giá chuyên gia 35 điểm và đánh giá người dùng 25 điểm.

Phần benchmark kết hợp điểm AAII (25 điểm) từ tổ chức đánh giá AI toàn cầu Artificial Analysis và điểm benchmark riêng (15 điểm) của Cơ quan Xúc tiến Xã hội Thông tin Quốc gia Hàn Quốc (NIA). Cách tính này nhằm xem xét đồng thời năng lực nền tảng, khả năng tiếng Hàn và độ tin cậy của mô hình.

Motif Technologies đạt 24,6 điểm benchmark tổng, cao nhất trong bốn đội tham gia. Ở phần AAII, công ty này cũng dẫn đầu với 11,9 điểm.

Ở phần benchmark của NIA, Motif Technologies đạt 12,7 điểm. Tính chung cả phần benchmark, Motif Technologies vẫn vượt qua Upstage (22,7 điểm), SK Telecom (22,2 điểm) và LG AI Research (20,6 điểm).

Kết quả đậu - rớt được quyết định ở phần đánh giá chuyên gia và đánh giá người dùng. Ở đánh giá chuyên gia, LG AI Research dẫn đầu với 29,5 điểm, theo sau là SK Telecom 29,3 điểm, Upstage 29,1 điểm và Motif Technologies 27,1 điểm.

Ở đánh giá người dùng, SK Telecom đạt 19,1 điểm, LG AI Research 18,9 điểm, Upstage 18,1 điểm và Motif Technologies 14,1 điểm. Chênh lệch điểm tổng cuối cùng giữa SK Telecom và Motif Technologies chỉ là 4,8 điểm, trong khi khoảng cách 5 điểm ở phần đánh giá người dùng chính là yếu tố quyết định kết quả này.

Đánh giá người dùng là điểm tổng hợp từ nhóm người dùng chuyên về AI và nhóm người dân phổ thông. Thực tế có 49 người tham gia nhóm người dùng chuyên về AI và 185 người tham gia nhóm người dân phổ thông. Motif Technologies đạt 8,4 điểm ở nhóm người dùng chuyên về AI và 5,7 điểm ở nhóm người dân phổ thông.

Việc công bố điểm số giúp lý do bị loại trở nên rõ ràng hơn trước đây. Tuy nhiên, tranh cãi cốt lõi vẫn còn đó: dự án mô hình nền tảng AI độc lập này thực chất muốn chọn ra loại mô hình như thế nào.

Mô hình nền tảng (foundation model) là mô hình gốc có thể được ứng dụng cho nhiều dịch vụ và ngành khác nhau. Điểm benchmark thường được dùng làm chỉ số phản ánh năng lực nền tảng của mô hình, còn đánh giá người dùng lại phản ánh mức độ tiện dụng và hoàn thiện trong môi trường sử dụng thực tế.

Bộ Khoa học và Công nghệ Thông tin Truyền thông Hàn Quốc cho biết tiêu chí và phương thức đánh giá đã được thống nhất trước với các đội tham gia, và tại thời điểm đó không có ý kiến phản đối nào. Bộ này cũng giải thích rằng tiêu chí đánh giá theo từng giai đoạn được xây dựng theo phương thức “mục tiêu di động” (moving target), tức điều chỉnh mục tiêu phát triển mỗi 6 tháng để phản ánh tốc độ thay đổi nhanh của công nghệ AI.

Đây không phải lần đầu dự án mô hình nền tảng AI độc lập gây tranh cãi. Ở vòng đánh giá đầu tiên, Naver Cloud từng bị loại với lý do mô hình chưa đáp ứng được tính độc lập. Motif Technologies sau đó được chọn bổ sung, và giờ đây công ty này cũng lên tiếng phản đối kết quả vòng đánh giá thứ hai.

Xoay quanh tranh cãi lần này, nhiều ý kiến cho rằng rất khó để đánh giá năng lực và khả năng ứng dụng thực tế của một mô hình AI chỉ bằng một điểm số duy nhất. Một mô hình có điểm benchmark cao nhưng khả năng sử dụng thấp vẫn có thể bị loại ở đánh giá tổng thể, trong khi một mô hình dễ sử dụng cũng khó tránh khỏi tranh cãi về năng lực nền tảng. TokenPost từng đưa tin rằng cấu trúc chấm điểm và hạ tầng đánh giá (evaluation harness) có ảnh hưởng trực tiếp đến cách diễn giải kết quả trong các bài đánh giá benchmark AI.

Bộ Khoa học và Công nghệ Thông tin Truyền thông Hàn Quốc cho biết đang thảo luận với các bộ, ngành liên quan về một cơ chế hỗ trợ mới vượt ra ngoài phương thức hiện tại, và sẽ chuẩn bị nội dung cụ thể để công bố sau.

<Bản quyền ⓒ TokenPost, nghiêm cấm sao chép và phân phối trái phép>

Phổ biến nhất

Các bài viết liên quan khác

Bình luận 0

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.

0/1000

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.
1