Vals AI huy động 40 triệu USD (khoảng 55,5 tỷ won) trong vòng Series A, đồng thời mở rộng hoạt động đánh giá năng lực thực tế của các mô hình và tác nhân AI. Công ty sử dụng bộ dữ liệu kiểm thử kín để đo lường hiệu suất trong các lĩnh vực như pháp lý, tài chính và lập trình.
Vals AI công bố ngày 13 tháng 8 rằng công ty đã huy động vốn Series A với mức định giá 400 triệu USD (khoảng 554,8 tỷ won). Andreessen Horowitz dẫn đầu vòng đầu tư, với sự tham gia của các nhà đầu tư hiện hữu 8VC, Pear VC và Bloomberg Beta, cùng các nhà đầu tư mới HRT Ventures và Next Ladder Ventures.
TechCrunch đưa tin Vals AI được thành lập năm 2024 và từng huy động vốn hạt giống do 8VC và Bloomberg Beta dẫn đầu. Quy mô vòng hạt giống chưa được công bố.
Thay vì tự phát triển mô hình AI, Vals AI tập trung đo lường mức độ hoàn thành công việc thực tế của mô hình, tác nhân và dịch vụ ứng dụng. Với các nhiệm vụ trong nghiên cứu pháp lý, phân tích tài chính, thanh toán y tế và lập trình, công ty đánh giá không chỉ độ chính xác mà còn cả chi phí, độ trễ, loại lỗi và khả năng sử dụng công cụ.
Phương thức đánh giá cốt lõi của Vals AI là bộ dữ liệu kiểm thử kín. Các đề kiểm tra công khai có thể xuất hiện trong dữ liệu huấn luyện của mô hình hoặc bị nhà phát triển điều chỉnh theo đề, khiến điểm benchmark không phản ánh đúng hiệu suất thực tế.
Vals AI phân biệt giữa bộ xác minh công khai, bộ xác minh kín và bộ kiểm thử kín. Công ty cho biết điểm benchmark chính thức được tính bằng bộ kiểm thử không công khai, qua đó hạn chế khả năng dữ liệu đánh giá bị đưa vào quá trình huấn luyện.
Tuy nhiên, phương thức kín cũng tạo ra thách thức về khả năng tái lập. Các nhà nghiên cứu bên ngoài khó tiến hành thử nghiệm với cùng câu hỏi và điều kiện, nên Vals AI công khai hạ tầng đánh giá và một số công cụ để hỗ trợ tái lập quy trình.
Phạm vi đánh giá của công ty cũng đang được mở rộng. Vals AI phối hợp với CoreWeave công bố RSI Index, đánh giá liệu mô hình AI có thể thực hiện nghiên cứu cần thiết để phát triển mô hình tiếp theo hay không. Công ty cũng đang thúc đẩy các đánh giá liên quan đến an ninh mạng và sức khỏe tâm thần.
Vals AI cũng công bố Vals Smith. Người dùng có thể tạo benchmark lập trình tùy chỉnh dựa trên kho lưu trữ GitHub, trong khi người dùng ban đầu được cung cấp 120 tín dụng miễn phí.
Vals AI cho biết doanh thu tăng 8 lần so với cả năm 2025, cơ sở khách hàng tăng gấp đôi và số nhân viên tăng gấp 3 lần trong 6 tháng gần nhất. Đây là các số liệu do công ty công bố và chưa xác nhận liệu đã được kiểm toán độc lập hay chưa.
Vals Index đo lường hiệu suất của các tác nhân AI trong công việc tài chính, lập trình và pháp lý tính đến ngày 15 tháng 9 năm 2026, đồng thời tính điểm tổng hợp dựa trên tỷ trọng của từng ngành trong GDP Mỹ. Khi đó, có 58 mô hình nằm trong phạm vi đánh giá.
Rayan Krishnan, đồng sáng lập Vals AI, cho biết các benchmark học thuật hiện tại không theo kịp tốc độ phát triển của các mô hình AI. Theo ông, cần đánh giá liệu mô hình có tạo ra kết quả chất lượng tương đương con người trong công việc thực tế hay không, cũng như khả năng gây ra các kết quả tiêu cực.
Vals AI cho biết kết quả đánh giá của mình đã được trích dẫn trong model card của các mô hình thuộc OpenAI, Anthropic, Google, Meta và xAI. Tuy nhiên, cần xác minh riêng việc mối quan hệ giữa các nhà đầu tư với các công ty AI có ảnh hưởng như thế nào đến tính độc lập của hoạt động đánh giá.
Khi số lượng công ty phát triển mô hình AI và khách hàng doanh nghiệp tăng lên, tầm quan trọng của một tiêu chuẩn chung để so sánh hiệu suất công việc thực tế cũng tăng theo. Bộ kiểm thử kín có thể giảm ô nhiễm dữ liệu, nhưng việc bảo đảm tính minh bạch và khả năng tái lập của kết quả đánh giá vẫn là bài toán Vals AI cần giải quyết.
Vals AI cho biết cùng với khoản đầu tư mới, công ty sẽ mở rộng các công cụ và lĩnh vực đánh giá mô hình AI. Phạm vi đánh giá dự kiến vượt ra ngoài pháp lý, tài chính và lập trình để bao gồm y tế và an ninh mạng.
Bình luận 0