TwelveLabs ra mắt Pegasus 1.6, mô hình tạo sinh phân tích video quay từ góc nhìn của người lao động. Mô hình chuyển động tác và thông tin bối cảnh thành văn bản có cấu trúc, hướng đến việc phân loại và rà soát video robot, AI vật lý.
Trong thông cáo ngày 6, TwelveLabs giới thiệu Pegasus 1.6 là mô hình hỗ trợ hiểu video góc nhìn thứ nhất. Đây là video được quay từ góc nhìn của người lao động hoặc người điều khiển. Công ty nêu các ứng dụng như nấu ăn, lắp ráp trong nhà máy và điều khiển robot từ xa.
Mô hình phân biệt các bước công việc và tương tác giữa bàn tay với vật thể, đồng thời gắn thông tin thời gian. Mô hình cũng tạo câu mô tả quan hệ không gian và bối cảnh cảnh quay. Các tính năng khác gồm đánh giá độ rõ nét, bố cục và độ ổn định của video để chọn nội dung cần rà soát, cùng khả năng tìm kiếm bằng ngôn ngữ tự nhiên. Thông cáo cũng đề cập tính năng phát hiện và đánh dấu thông tin nhạy cảm xuất hiện trên khuôn mặt, người xung quanh, màn hình hoặc tài liệu.
Tài liệu dành cho nhà phát triển của TwelveLabs liệt kê các tính năng mới gồm hiểu video góc nhìn thứ nhất, phân tích hình ảnh, nhận diện đối tượng và trích xuất siêu dữ liệu được cải thiện, cùng trích xuất sự kiện có mốc thời gian trong từng đoạn video. Tài liệu cũng nêu việc rà soát chất lượng video robot và dự đoán hành động tiếp theo trong video điều khiển từ xa. Đây là các tính năng và ví dụ ứng dụng do công ty giới thiệu.
Đợt ra mắt này là nỗ lực áp dụng mô hình hiểu video vào xử lý dữ liệu cho robot và AI vật lý. Trước đó, TokenPost từng đưa tin về dòng vốn đầu tư vào lĩnh vực robot và AI vật lý. Thông cáo và tài liệu chính thức chưa nêu đánh giá độc lập chứng minh Pegasus 1.6 cải thiện hiệu suất huấn luyện robot hoặc độ an toàn tại nơi làm việc, cũng như trường hợp khách hàng triển khai mô hình.
Bình luận 0