L'ère de la production vidéo par intelligence artificielle a commencé
La startup d'intelligence artificielle derrière Stable Diffusion teste désormais son outil d'IA générative pour la vidéo. Il est capable de créer des vidéos à partir d'une image fixe.
Nous avons déjà vu des modèles d'intelligence artificielle capables de produire des vidéos, mais Stability AI, la startup derrière Stable Diffusion, entre dans ce domaine et place la barre très haut en termes de qualité. Le nouveau modèle Stable Video Diffusion, qui se distingue de ses concurrents par sa qualité et son réalisme, permet aux utilisateurs de créer des vidéos à partir d'une seule image.
L'INTELLIGENCE ARTIFICIELLE PEUT AUSSI CRÉER DES VIDÉOS
Comme le rapporte Donanımhaber, Stable Video Diffusion se décline en deux modèles : SVD et SVD-XT. Le premier, SVD, transforme des images fixes en vidéos de 576×1024 pixels en 14 images. SVD-XT utilise la même architecture, mais porte le nombre d'images à 24. Tous deux peuvent produire des vidéos allant de trois à 30 images par seconde. Ces résultats semblent être à égalité, voire de meilleure qualité, que ceux obtenus par le dernier modèle de création vidéo de Meta, ainsi que ceux de Google et des startups d'IA Runway et Pika Labs.

Par ailleurs, Stable Video Diffusion n'est pour l'instant disponible qu'à des fins de recherche, et non pour des applications réelles ou commerciales. Stability AI indique que les utilisateurs potentiels peuvent s'inscrire sur une liste d'attente pour y accéder, et l'outil pourrait être utilisé dans des applications potentielles dans les secteurs de la publicité, de l'éducation, du divertissement et bien d'autres.
DES LACUNES SUBSISTENT
Les exemples présentés dans la vidéo publiée semblent être de qualité relativement élevée et rivalisent avec les systèmes génératifs concurrents. Cependant, selon l'entreprise, certaines lacunes subsistent : il produit des vidéos relativement courtes (moins de 4 secondes), manque d'un photoréalisme parfait, ne peut pas effectuer de mouvements de caméra autres que des panoramiques lents, ne dispose pas de contrôle textuel, ne peut pas générer de texte lisible et peut avoir des difficultés à générer correctement des personnes et des visages.
Concernant l'entraînement, Stability AI précise que l'outil a été formé sur un ensemble de données composé de millions de vidéos, puis a fait l'objet d'un réglage fin sur un ensemble de données plus restreint, allant de quelques centaines de milliers à un million de vidéos. Stability AI souligne qu'elle n'a utilisé que des vidéos accessibles au public à des fins de recherche.
Tout comme les outils d'IA de conversion de texte en image ont rapidement évolué pour atteindre un niveau photoréaliste, les IA génératrices de vidéo seront bientôt capables de produire des contenus beaucoup plus réalistes. Tout cela s'accompagne de risques liés aux deepfakes, aux droits d'auteur et à diverses utilisations abusives. Il est donc essentiel que ces développements se fassent dans le respect de certaines limites.
Source de l'actualité: 12punto
Actualités connexes
Les plus lus
Vive réaction de l'Iran à l'attaque ukrainienne en mer Caspienne
Nos citoyens syriaques et arméniens disent « Que Dieu bénisse Erdoğan »
Le « brouillon » de Lausanne de la présidence... Le nouveau parti d'Özgür Özel...
Il fait un signe de la main à son interlocuteur au téléphone, puis tue le glacier
Si vous n'aviez pas d'argent, vous ne pouviez pas vous faire soigner ; désormais, vous ne pouvez même plus devenir médecin
Une femme sort à moitié nue dans la rue puis se jette du 3e étage
Les « Sultanes du Filet » sont championnes de la Ligue des Nations FIVB 2026 !
Qu'ont-ils exigé d'İsmet Pacha à Lausanne ?
Allégation de « démission de 10 députés » au sein du YENİ Parti
Des figurants engagés pour 950 lires lors d'une cérémonie d'adhésion du CHP