Google vừa chính thức ra mắt Gemini Omni Flash, mô hình đầu tiên thuộc dòng AI “Omni” mới với khả năng tạo video từ nhiều loại dữ liệu đầu vào khác nhau như văn bản, hình ảnh, âm thanh và video. Không chỉ dừng lại ở việc tạo video, Gemini Omni Flash còn cho phép người dùng chỉnh sửa nội dung thông qua các câu lệnh ngôn ngữ tự nhiên, giúp quá trình sáng tạo trở nên trực quan và linh hoạt hơn.
Những điểm nổi bật khi ra mắt Gemini Omni Flash
Tạo video từ nhiều nguồn dữ liệu cùng một lúc
Khác với Veo trước đây vốn chủ yếu hoạt động dựa trên văn bản và hình ảnh, Omni Flash hỗ trợ kết hợp nhiều loại dữ liệu đầu vào trong cùng một yêu cầu. Người dùng có thể cung cấp ảnh tĩnh, video mẫu, tệp âm thanh hoặc mô tả bằng văn bản để AI tổng hợp thành một video hoàn chỉnh.

Ở thời điểm hiện tại, dữ liệu âm thanh đầu vào mới chỉ hỗ trợ giọng nói, trong khi các loại âm thanh khác sẽ được Google bổ sung trong tương lai.
Chỉnh sửa video bằng hội thoại qua nhiều lượt
Sau khi tạo thước phim, người sử dụng có thể tiếp tục yêu cầu AI thay đổi môi trường, góc quay, phong cách hình ảnh hoặc các chi tiết cụ thể bằng ngôn ngữ tự nhiên. Hệ thống được thiết kế để duy trì tính nhất quán của nhân vật, bối cảnh và các yếu tố vật lý xuyên suốt nhiều lần chỉnh sửa.

Với cách tiếp cận mới, Gemini Omni Flash giờ đây không còn đơn thuần là công cụ tạo video một lần mà trở thành một “trợ lý hậu kỳ” có thể tương tác liên tục với người dùng.
Mô phỏng vật lý và tạo nội dung giáo dục tốt hơn
Google cũng nhấn mạnh rằng Gemini Omni Flash được cải thiện đáng kể về khả năng mô phỏng các hiện tượng vật lý như trọng lực, động năng hay chuyển động của chất lỏng.

Trong video mẫu, AI có thể tạo ra những cảnh như nghệ sĩ violin biểu diễn, viên bi lăn qua hệ thống phản ứng dây chuyền hoặc video stop-motion mô phỏng quá trình gấp cuộn protein.

Bên cạnh đó, nhờ tận dụng kho kiến thức của Gemini, mô hình còn được định hướng phục vụ các nội dung giải thích, giáo dục hoặc tài liệu mang tính học thuật. Google cho rằng điều này giúp video có cơ sở thông tin tốt hơn thay vì chỉ dựa trên việc học mẫu dữ liệu.
Tạo avatar số bằng giọng nói cá nhân
Một tính năng khác thu hút nhiều sự chú ý là Avatars, cho phép người dùng tạo phiên bản kỹ thuật số của chính mình để sản xuất video bằng giọng nói cá nhân.

Google vẫn đang nghiên cứu cách triển khai các công cụ chỉnh sửa âm thanh và lời thoại một cách có trách nhiệm. Do đó, các tính năng chỉnh sửa giọng nói trực tiếp trong video hiện chưa được kích hoạt.

Động thái này được xem là khá thận trọng trong bối cảnh các công cụ AI tạo video ngày càng làm dấy lên nhiều tranh luận liên quan đến tin giả, truyền thông và các nội dung chính trị.
Tích hợp dấu bản quyền và xác thực nguồn gốc nội dung
Khi ra mắt, tất cả video được tạo bằng Gemini Omni Flash đều được gắn watermark kỹ thuật số SynthID, công nghệ giúp nhận diện nội dung AI do Google phát triển.

Người dùng có thể xác minh watermark này thông qua ứng dụng Gemini, Gemini trên Chrome hoặc Google Search. Theo Google, việc xác thực nguồn gốc nội dung đang trở nên quan trọng hơn bao giờ hết khi các video AI ngày càng khó phân biệt với nội dung thật.
Đây cũng là phản ứng của Google trước những tranh cãi gần đây liên quan đến các video giả mạo người nổi tiếng được tạo bằng AI và lan truyền rộng rãi trên mạng xã hội.
Tổng kết
Gemini Omni Flash khi được ra mắt cho thấy tham vọng lớn của Google trong lĩnh vực AI sáng tạo nội dung khi kết hợp khả năng tạo video, chỉnh sửa bằng hội thoại tự nhiên, mô phỏng vật lý, tạo avatar số và xác thực nguồn gốc nội dung trong một nền tảng thống nhất.
Dù vẫn cần thời gian để kiểm chứng hiệu quả trong các quy trình sản xuất chuyên nghiệp, đây rõ ràng là một bước tiến đáng chú ý, đặc biệt khi Google đang hướng tới việc biến AI thành công cụ sáng tạo toàn diện cho cả nhà làm phim, content creator lẫn người dùng phổ thông.
















































