OpenRouter vừa ra mắt công cụ đánh giá mang tên Ori Eval, giúp so sánh hiệu năng, tốc độ và chi phí của các mô hình AI dựa trên mã nguồn và quy trình công việc thực tế của lập trình viên. Công cụ này giảm bớt gánh nặng phải tự thử nghiệm từng mô hình một, đồng thời giúp lập trình viên tìm ra mô hình phù hợp nhất cho sản phẩm của mình.
Theo blog chính thức của OpenRouter ngày 4, Ori Eval chạy trực tiếp các prompt thực tế trong ứng dụng, kiểm tra khả năng gọi công cụ (tool calling) và chất lượng câu trả lời, từ đó đưa ra cơ sở để lựa chọn mô hình. OpenRouter là dịch vụ dạng cổng kết nối, cho phép sử dụng nhiều mô hình AI khác nhau chỉ thông qua một API duy nhất.
Khác với các bảng xếp hạng công khai vốn chỉ so sánh thứ hạng tổng quát của mô hình, Ori Eval tập trung đánh giá xem mô hình nào hoạt động tốt nhất cho một dịch vụ cụ thể. Ý tưởng này xuất phát từ thực tế rằng các bài kiểm tra chuẩn (benchmark) thông thường hay các đề xuất trên mạng xã hội khó phản ánh đúng dữ liệu, prompt và môi trường vận hành riêng của từng sản phẩm.
Công cụ này quét mã nguồn của lập trình viên để tìm ra các điểm gọi mô hình, sau đó tạo ra file đánh giá tương ứng. Các mô hình ứng viên sau đó được chạy trong cùng điều kiện để so sánh kết quả. Lập trình viên có thể tự đặt ra các tiêu chí cần thiết cho sản phẩm như độ chính xác, tốc độ, chi phí, độ trễ và độ chính xác khi gọi công cụ.
Trong quá trình đánh giá, môi trường thực thi, cấu hình mô hình và mức độ suy luận (reasoning) được giữ cố định. Cách thiết kế này nhằm tránh tình trạng mỗi mô hình ứng viên chịu điều kiện khác nhau khiến kết quả bị sai lệch.
Nội dung đánh giá được lưu dưới dạng file mã nguồn định dạng “*.eval.ts” và chạy bằng lệnh “bun test”. Hệ thống kiểm tra xem tác nhân AI (agent) có gọi đúng công cụ cần thiết hay không, có tránh được công cụ không nên chạy hay không, và có hoàn thành câu trả lời trọn vẹn hay không. Với những câu trả lời không có đáp án cố định, hệ thống có thể dùng một mô hình ngôn ngữ lớn (LLM) khác để chấm điểm.
Ori Eval còn cho phép chuyển mô tả lỗi bằng ngôn ngữ tự nhiên thành bài kiểm tra. Ví dụ, nếu nhập vào vấn đề tác nhân hỗ trợ khách hàng xử lý hoàn tiền mà không tra cứu đơn hàng, hệ thống sẽ tạo ra bài đánh giá kiểm tra xem công cụ tra cứu đơn hàng có được gọi hay không. Sau khi sửa lỗi, lập trình viên có thể chạy lại đúng bài đánh giá đó để xác nhận vấn đề không còn tái diễn.
Khi kết nối với GitHub Actions, các bài đánh giá có thể được dùng như bài kiểm tra hồi quy. Nếu đánh giá thất bại, tác vụ tích hợp liên tục (CI) cũng được thiết lập để báo lỗi, và có thể chạy thủ công hoặc tự động theo lịch định sẵn.
Việc ra mắt Ori Eval cho thấy phạm vi kinh doanh của OpenRouter đang mở rộng từ vai trò trung gian cung cấp mô hình sang cả mảng quản lý phát triển và vận hành. Hồi tháng 7, OpenRouter từng giới thiệu công cụ Classifiers theo dõi công việc và chi phí của tác nhân AI, đồng thời công bố phương pháp đánh giá hiệu năng của các nhà cung cấp mô hình ngôn ngữ lớn dựa trên độ trễ, thông lượng và thời gian hoạt động. Trước đó, TokenPost từng đưa tin về việc OpenRouter phân tích mức sử dụng và hiệu năng của các mô hình AI dựa trên nhật ký của lượng lớn yêu cầu.
Mối liên hệ trực tiếp với tiền mã hóa của OpenRouter chỉ dừng ở phương thức thanh toán. Ngoài thẻ tín dụng và Alipay, OpenRouter còn hỗ trợ thanh toán bằng USD Coin(USDC), một stablecoin có giá trị gắn với đồng USD. Bản thân Ori Eval không được giới thiệu là dịch vụ blockchain hay dự án token.
Nguồn xác minh: blog Ori Eval, tài liệu hướng dẫn Ori Eval, hướng dẫn bắt đầu nhanh, mục hỏi đáp thường gặp của OpenRouter.
Bình luận 0