Back to top
  • 공유 Chia sẻ
  • 인쇄 In
  • 글자크기 Cỡ chữ
URL đã được sao chép

Gemini Omni 1.1 Flash: Google(GOOGL) nâng video AI lên 4K

Màn hình chỉnh sửa video hiển thị trên máy tính bảng / TokenPost.ai

Google(GOOGL) vừa công bố mô hình AI tạo video Gemini Omni 1.1 Flash (Gemini Omni 1.1 Flash), bổ sung khả năng nâng cấp độ phân giải tối đa lên 4K, nối dài cảnh quay và chỉ định khung hình đầu - khung hình cuối. Xu hướng sản xuất nội dung bằng AI tạo sinh vốn tập trung vào văn bản và hình ảnh nay đang mở rộng sang chỉnh sửa video và quy trình sản xuất lặp đi lặp lại.

Theo blog chính thức của Google đưa tin ngày 27 (giờ địa phương), Gemini Omni 1.1 Flash đã có thể sử dụng thông qua Gemini API trên Google AI Studio và nền tảng agent doanh nghiệp Gemini Enterprise. Trên Google Flow, mô hình được cung cấp trên toàn cầu cho người dùng đăng ký AI Plus, Pro và Ultra của Google, còn ứng dụng Gemini được bổ sung tính năng nối dài cảnh quay.

Mô hình mới nhận đầu vào là văn bản, hình ảnh và video để tạo video mới hoặc chỉnh sửa video sẵn có. Tài liệu dành cho nhà phát triển của Google cho biết mã mô hình là "gemini-omni-1.1-flash", hỗ trợ dữ liệu đầu vào gồm văn bản, hình ảnh và video.

Video tải lên để chỉnh sửa hoặc nối dài có thời lượng tối đa 10 giây, trong khi video đầu ra được tạo với độ dài từ 3 đến 10 giây. Cấu trúc này phù hợp với cách sản xuất nối tiếp nhiều đoạn video ngắn để tạo thành mạch cảnh hoàn chỉnh.

Thay đổi cốt lõi nằm ở chỗ người sáng tạo có thể kiểm soát cảnh quay chi tiết hơn. Người dùng có thể gắn thêm cảnh mới vào sau video đã có, và mô hình sẽ tham chiếu tối đa 10 giây video trước đó để giữ nguyên chuyển động, nhân vật và mạch cảnh. Google cho biết trên blog chính thức rằng video có thể được nối dài theo từng đoạn 10 giây, tích lũy tối đa 40 giây.

Tính năng chỉ định khung hình đầu và khung hình cuối cũng được bổ sung. Khi người dùng đưa vào ảnh mở đầu và ảnh kết thúc, mô hình sẽ nối liền hai cảnh này thành một video liên tục. Tính năng được thiết kế cho các thao tác cần sự liền mạch giữa các cảnh, như di chuyển góc máy, chuyển cảnh zoom hay video lặp lại.

Tính năng đưa video tham chiếu vào được dùng cho các thao tác cần giữ nguyên chuyển động nhân vật hoặc bối cảnh hình ảnh. Người dùng có thể đưa vào video tham chiếu tối đa 3 giây để tạo video mới. Đây là cách cung cấp cho mô hình cả thông tin chuyển động lẫn không khí của cảnh quay, điều mà một tấm ảnh tĩnh khó truyền tải được.

Độ phân giải được hỗ trợ gồm 360p, 720p, 1080p và 4K. Tài liệu dành cho nhà phát triển của Google cho biết 720p là mức mặc định, còn 1080p và 4K được tạo ra theo phương thức nâng cấp (upscale). Dù 4K được quảng bá là điểm nhấn, quy trình sản xuất thực tế vẫn hướng đến việc tách bản nháp độ phân giải thấp và bước hậu kỳ độ phân giải cao.

Google cho biết việc tạo bản nháp ở 360p nhanh hơn tới 60% so với 720p tính theo thông lượng xử lý hệ thống, trong khi chi phí chỉ bằng khoảng một phần ba. Nhờ đó, người sáng tạo có thể thử nhiều bản nháp ở độ phân giải thấp trước, rồi chỉ xuất lại ở độ phân giải cao với những kết quả thực sự cần dùng. Đây cũng là lý do giới quan sát nhận định cuộc đua AI tạo video đang chuyển dịch sang cả yếu tố chi phí sản xuất lặp lại, chứ không chỉ chất lượng.

Mức phí được tính theo API trả phí. Tài liệu dành cho nhà phát triển của Google cho biết phí xuất video là 17,50 USD cho mỗi 1 triệu token, còn video 720p được tính theo 5.792 token mỗi giây, tương đương khoảng 0,10 USD/giây.

Theo báo cáo của Digital Today, mức phí API tính theo độ phân giải lần lượt là 0,03 USD/giây cho 360p, 0,10 USD/giây cho 720p, 0,15 USD/giây cho 1080p và 0,30 USD/giây cho 4K. Nếu áp theo tỷ giá 1 USD đổi 1.382 won Hàn Quốc, các mức phí này tương ứng khoảng 41 won, 138 won, 207 won và 415 won.

Các mô hình tạo video thường phải thử cùng một câu lệnh (prompt) nhiều lần rồi chọn ra kết quả ưng ý. Vì vậy, chi phí tạo bản nháp và tốc độ lặp lại cũng quan trọng không kém độ phân giải của sản phẩm cuối cùng. Việc Google đồng thời nhấn mạnh khả năng tạo bản nháp 360p và nâng cấp lên 4K được xem là nỗ lực mở rộng biên độ điều chỉnh giữa chi phí sản xuất và chất lượng.

Lần ra mắt này nằm trong xu hướng chung khi dòng sản phẩm AI tạo sinh của Google mở rộng từ văn bản, hình ảnh sang quy trình sản xuất video. Trước đó, TokenPost từng đưa tin Google đã để lộ tùy chọn tắt watermark hiển thị trên nội dung do AI tạo ra trong Gemini và Flow. Tuy nhiên, bài viết đó cũng cho biết watermark hiển thị được áp dụng tự động với người dùng cư trú tại Hàn Quốc, nên phạm vi tính năng thực tế mà người dùng tại từng khu vực được trải nghiệm có thể khác nhau tùy theo khu vực tài khoản và cấu hình sản phẩm.

Với các nhà sáng tạo và lập trình viên, phạm vi triển khai tính năng và cách tính phí sẽ là yếu tố then chốt. Phạm vi cung cấp tài khoản tại từng khu vực trên Google Flow và Gemini API, mức phí theo từng độ phân giải, cùng chính sách watermark có thể trở thành tiêu chí lựa chọn thực tế khi đưa công cụ này vào quy trình sản xuất.

<Bản quyền ⓒ TokenPost, nghiêm cấm sao chép và phân phối trái phép>

Phổ biến nhất

Các bài viết liên quan khác

Bình luận 0

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.

0/1000

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.
1