Back to top
  • 공유 Chia sẻ
  • 인쇄 In
  • 글자크기 Cỡ chữ
URL đã được sao chép

GPT-6 Astra đạt 58,3 điểm trong đánh giá tổng hợp HealthBench

Tài liệu đánh giá AI chăm sóc sức khỏe và ống nghe / TokenPost.ai (mono)

GPT-6 Astra đạt 58,3 điểm trong đánh giá tổng hợp HealthBench, một bộ đánh giá trí tuệ nhân tạo liên quan đến sức khỏe. Điểm 57,3 của “Mental Health Bench” được nêu trong một bài viết riêng cần được phân biệt với kết quả đánh giá chính thức của OpenAI.

OpenAI công bố trong system card chính thức của GPT-6 Astra các điểm số gồm 64,7 điểm ở HealthBench Professional, 36,6 điểm ở HealthBench Hard và 95,5 điểm ở HealthBench Consensus. Đối tượng đánh giá và phương pháp tính điểm của từng bài đánh giá là khác nhau.

Crypto Briefing đưa tin ngày 23 rằng OpenAI đã phát triển “Mental Health Bench” dựa trên sự tham gia của hơn 80 chuyên gia sức khỏe tâm thần tại 22 quốc gia, đồng thời GPT-6 Astra đạt 57,3 điểm. Bài viết này nêu các tiêu chí đánh giá gồm mức độ an toàn, sự phù hợp với bối cảnh, quyền tự chủ của người dùng và hướng dẫn có thể thực hiện.

Tuy nhiên, system card do OpenAI công bố ghi HealthBench chứ không phải “Mental Health Bench”. Các chi tiết như hơn 80 chuyên gia tham gia, 22 quốc gia, thang điểm từ -1 đến +10 và ưu thế so với các mô hình trước đó cũng chưa được xác nhận trong tài liệu chính thức của OpenAI.

Điểm HealthBench được tổng hợp bằng phương pháp điều chỉnh theo độ dài. OpenAI cho biết điểm HealthBench Professional cao hơn GPT-5.6 Sol 4,2 điểm, điểm tổng HealthBench tăng 1,3 điểm và HealthBench Hard cải thiện 3,5 điểm.

Do đó, không thể so sánh đơn giản 58,3 điểm của HealthBench tổng hợp với 57,3 điểm của Mental Health Bench. Tên đánh giá, hệ thống điểm và đối tượng đánh giá có thể khác nhau.

OpenAI cho biết họ cũng tiến hành đánh giá hội thoại nhiều lượt về sức khỏe tâm thần, sự phụ thuộc cảm xúc và hành vi tự hại. Phương pháp này không chỉ đánh giá câu trả lời cho một câu hỏi cố định mà giả định cuộc trò chuyện tiếp diễn tùy theo phản hồi của mô hình.

Đánh giá này sử dụng mô phỏng người dùng có thái độ đối địch. Tỷ lệ phản hồi không vi phạm chính sách an toàn được tổng hợp thành chỉ số “safe”, và OpenAI cho biết GPT-6 Astra đã cải thiện ở cả ba lĩnh vực so với GPT-5.6 Sol.

Tuy vậy, các trường hợp dùng để đánh giá chủ yếu là những tình huống khó, trong đó các mô hình trước đây không đưa ra được câu trả lời lý tưởng. OpenAI nhấn mạnh kết quả này không phản ánh tỷ lệ lỗi trong môi trường sử dụng thực tế.

HealthBench đánh giá khả năng xử lý tình huống cấp cứu, xác nhận bối cảnh và giao tiếp phù hợp với chuyên môn trong các cuộc hội thoại về sức khỏe. Các bác sĩ xem xét liệu tình huống có cần chăm sóc cấp cứu hay không và liệu khuyến nghị tìm kiếm chăm sóc cấp cứu có được đưa ra rõ ràng ở phần đầu câu trả lời khi cần thiết hay không.

Nghiên cứu HealthBench chỉ ra rằng các mô hình vẫn có dư địa cải thiện trong việc xác nhận đầy đủ bối cảnh cần thiết và xử lý sự không chắc chắn. Đây cũng là lý do các đánh giá hội thoại về sức khỏe tâm thần cần xem xét cả khả năng nhận diện khủng hoảng và mức độ an toàn của quá trình tương tác, thay vì chỉ dựa vào một điểm số.

Hiệp hội Tâm thần học Mỹ cho biết trong khảo sát năm 2026, 17% người trưởng thành từng trao đổi với chatbot AI về vấn đề sức khỏe tâm thần. Có 35% cho biết họ sẵn sàng trò chuyện với chatbot AI thay vì chuyên gia sức khỏe tâm thần khi gặp khó khăn.

Trong khi đó, 58% bày tỏ lo ngại về việc sử dụng chatbot AI để tư vấn sức khỏe tâm thần cho trẻ em. Hiệp hội Tâm thần học Mỹ cho rằng AI không thể thay thế phán đoán lâm sàng hoặc hoạt động điều trị sức khỏe tâm thần chuyên nghiệp.

OpenAI công bố GPT-6 Astra ngày 3 tháng 9. OpenAI cho biết mô hình này cải thiện hiệu suất trong các lĩnh vực như sử dụng máy tính, kỹ thuật phần mềm, khoa học và an ninh mạng, đồng thời triển khai dịch vụ trả phí theo từng giai đoạn và API dành cho nhà phát triển của GPT-6 Astra.

Hiện system card chính thức chỉ xác nhận các điểm số HealthBench và đánh giá hội thoại nhiều lượt về sức khỏe tâm thần, sự phụ thuộc cảm xúc và hành vi tự hại. “Mental Health Bench 57,3 điểm” chưa thể được khẳng định là kết quả chính thức của OpenAI trước khi phương pháp và dữ liệu gốc của đánh giá riêng này được công bố.

<Bản quyền ⓒ TokenPost, nghiêm cấm sao chép và phân phối trái phép>

Phổ biến nhất

Các bài viết liên quan khác

Bình luận 0

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.

0/1000

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.
1