Mô hình embedding theo ngữ cảnh của Perplexity đạt 81.96% nDCG@10 trong bài kiểm thử truy xuất tài liệu ConTEB. Khác với cách xử lý riêng từng đoạn văn bản, mô hình phản ánh ngữ cảnh của toàn bộ tài liệu để cải thiện chất lượng truy xuất trong hệ thống sinh tăng cường truy xuất (RAG).
Perplexity công bố hai mô hình gồm ‘pplx-embed-v1’ cho truy xuất tiêu chuẩn và ‘pplx-embed-context-v1’ cho truy xuất theo ngữ cảnh vào ngày 26 tháng 2 năm 2026. Hai dòng mô hình có phiên bản 0.6B và 4B tham số, đồng thời hỗ trợ giấy phép MIT và API.
Mô hình theo ngữ cảnh không embedding độc lập từng đoạn khi tài liệu dài được chia nhỏ. Mô hình kết hợp câu trước, câu sau và thông tin toàn tài liệu để phân biệt những cách diễn đạt dễ mơ hồ nếu chỉ xem riêng đoạn văn, chẳng hạn đại từ hoặc tên doanh nghiệp.
Ví dụ, nếu chỉ xử lý câu ‘Ông trở thành hoàng đế vào năm 1804’, hệ thống sẽ khó xác định nhân vật được nhắc đến. Khi kết hợp thông tin về nhân vật xuất hiện ở phần trước của tài liệu, quá trình truy xuất có thể hiểu chính xác hơn ý nghĩa câu này.
Cách tiếp cận trên cho thấy ưu thế trong ConTEB, bộ kiểm thử đánh giá khả năng truy xuất khi cần đến ngữ cảnh toàn tài liệu. ‘pplx-embed-context-v1-4B’ của Perplexity đạt 81.96% nDCG@10.
Perplexity cho biết trong cùng phép so sánh, ‘voyage-context-3’ của Voyage đạt 79.45%, còn mô hình của Anthropic đạt 72.4%. Đây là kết quả do Perplexity đưa ra, trong khi các nghiên cứu liên quan cũng đề cập đến việc so sánh hiệu suất giữa các dòng mô hình.
Bảng so sánh được công bố trên OpenReview ghi nhận ‘pplx-embed-v1-4B’ dành cho truy xuất tiêu chuẩn đạt 69.66% nDCG@10 ở hạng mục truy xuất đa ngôn ngữ MTEB. Qwen3-Embedding-4B đạt 69.60%, còn ‘gemini-embedding-001’ đạt 67.71%.
Mô hình tiêu chuẩn và mô hình theo ngữ cảnh hướng đến các đối tượng sử dụng và điều kiện đánh giá khác nhau. Vì vậy, không thể xem 81.96% của ConTEB và 69.66% của MTEB là kết quả được đo trong cùng một điều kiện.
Các mô hình hỗ trợ cửa sổ ngữ cảnh 32K token và attention hai chiều. Chúng cũng hỗ trợ lượng tử hóa INT8 và nhị phân. Perplexity giải thích rằng lượng tử hóa nhị phân có thể giảm dung lượng lưu trữ tối đa 32 lần.
Giá API của mô hình tiêu chuẩn 4B là 0.03 đô la cho mỗi 1 triệu token (khoảng 41 won), còn mô hình theo ngữ cảnh 4B có giá 0.05 đô la (khoảng 68 won). Mức giá này được nêu trong thông báo chính thức của Perplexity.
ConTEB được thiết kế để đánh giá những tình huống câu trả lời không nằm đầy đủ trong một đoạn tài liệu mà cần đến thông tin từ toàn bộ tài liệu. Nghiên cứu về ConTEB giải thích rằng việc xử lý độc lập từng đoạn có thể làm suy yếu mối liên kết ngữ nghĩa trong tài liệu.
Hệ thống RAG thường chia tài liệu dài thành nhiều đoạn rồi lưu vào cơ sở dữ liệu vector. Nếu embedding từng đoạn riêng lẻ, chủ đề hoặc ngữ cảnh trước sau của tài liệu có thể không được phản ánh đầy đủ trong kết quả truy xuất.
Cộng đồng nhà phát triển cũng quan tâm đến tốc độ vận hành thực tế và mức sử dụng API, bên cạnh điểm số mô hình. Một nhà phát triển chia sẻ kết quả thử nghiệm cá nhân rằng trong cùng môi trường A100, tốc độ lập chỉ mục của ‘pplx-embed-v1-4B’ chậm hơn khoảng 7–8 lần so với Qwen3-Embedding-4B. Tuy nhiên, kết quả này không thể xem là hiệu suất phổ quát.
Trên diễn đàn dành cho nhà phát triển của Perplexity, người dùng cũng đặt vấn đề về việc lượng sử dụng API được tính theo số đoạn tài liệu thay vì số yêu cầu tài liệu. Perplexity trả lời rằng đây là cách hoạt động bình thường, đồng thời diễn đàn cho biết ký hiệu ‘QPS’ trong tài liệu đã được sửa thành ‘số đoạn có thể xử lý mỗi giây’.
Tính đến ngày 1 tháng 10 năm 2026, bộ sưu tập mô hình chính thức trên Hugging Face có các dòng ‘pplx-embed-v1’ và ‘pplx-embed-context-v1’. ‘pplx-embed-v2-context-9b-preview’ xuất hiện trong manh mối điều tra chưa được xác nhận trong thông báo chính thức hoặc model card, còn tuyên bố liên quan có trong bài đưa tin của Crypto Briefing.
Các nhà phát triển cân nhắc triển khai thực tế cần kiểm thử riêng tốc độ lập chỉ mục, mức sử dụng bộ nhớ, lượng đoạn tài liệu API xử lý và hiệu suất tìm kiếm tiếng Việt, bên cạnh điểm số benchmark. Việc Perplexity định hướng mô hình tiêu chuẩn và mô hình theo ngữ cảnh cho các mục tiêu khác nhau đã được trình bày trong nghiên cứu, còn so sánh hiệu suất của API tìm kiếm Perplexity cũng từng được TokenPost đưa tin.
Bình luận 0