Google lance le modèle Gemini Omni Flash 1.1 axé sur la production vidéo
Le nouveau modèle de Google se distingue par une analyse rétrospective de 10 secondes, une génération de brouillons plus rapide et des outils de montage de scènes.
12punto
Google a lancé la nouvelle version de sa famille d'IA multimodale Gemini Omni, baptisée Flash 1.1. Capable de traiter simultanément des données textuelles, visuelles, audio et vidéo, ce modèle vise à fournir des résultats plus cohérents, notamment dans les processus de production et de montage vidéo.
Selon l'annonce de l'entreprise, Gemini Omni Flash 1.1 est désormais accessible aux développeurs via AI Studio. L'un des changements les plus notables dans cette nouvelle version est la capacité d'étendre les vidéos non pas en se basant uniquement sur la dernière image, mais grâce à une analyse rétrospective de 10 secondes.
Cette méthode vise à permettre au modèle de mieux suivre l'intégrité des scènes, de maintenir les mouvements de caméra de manière plus naturelle et de réduire les erreurs de transition, en particulier dans les scènes dynamiques. Dans les approches précédentes, les opérations d'extension basées uniquement sur la dernière image pouvaient entraîner des problèmes de continuité.
VITESSE ET OUTILS DE MONTAGE MIS EN AVANT
Gemini Omni Flash 1.1 peut étendre des vidéos par segments de 10 secondes, jusqu'à une durée totale de 40 secondes. Les utilisateurs peuvent également définir les points de début et de fin des scènes en utilisant des extraits vidéo courts de trois secondes comme référence.
Google indique qu'en réduisant la résolution de 720p à 360p lors de la phase de production des brouillons, la vitesse du système a été augmentée jusqu'à 60 %. Parallèlement, la possibilité d'exporter le contenu finalisé en résolution 1080p ou 4K permet d'établir un équilibre entre une prévisualisation rapide et une sortie de haute qualité.
Les nouveaux outils de montage de scènes sont présentés comme des fonctionnalités capables d'accélérer les flux de travail assistés par l'IA, notamment dans la publicité, les réseaux sociaux et la production de contenu numérique. L'utilisation de vidéos de référence proposée par le modèle vise à aider à créer la composition souhaitée en un temps plus court.