Alibaba ouvre le framework d’animation 24 i/s Wan-Animate-2
Un système d’animation de personnages qui nécessitait autrefois un squelette prend désormais directement la vidéo de pilotage telle quelle. L’équipe Tongyi Wanxiang d’Alibaba a publié Wan-Animate-2 en open source, et le framework diffuse à 24 images par seconde tout en produisant des résultats jugés compétitifs face à des outils commerciaux fermés lors de tests comparatifs.
Le changement intervient avant le rendu de l’animation. Les anciens pipelines extrayaient la pose d’un personnage depuis la vidéo de pilotage, puis compressaient le mouvement en caractéristiques destinées au modèle. Wan-Animate-2 évite ces deux étapes : les pixels bruts sont injectés directement dans un Transformer de diffusion, un modèle génératif qui apprend comment transposer la performance de pilotage sur le personnage cible. Pandaily fait état de déformations plus nettes des mains et de moins d’artefacts sur les membres lors de mouvements complexes.
Le framework ne se limite pas à un personnage ou à un point de vue. Une seule vidéo de pilotage peut animer plusieurs personnages cibles à la fois, tandis que la même performance peut être rendue depuis plusieurs positions de caméra explicites sans réentraînement. Il gère également les rapports d’aspect non standard et différentes morphologies de personnages, des domaines dans lesquels les systèmes d’animation de personnages open source se sont souvent montrés fragiles.
Qu’est-ce que cela change en pratique ? Les développeurs et les créateurs peuvent accéder à des poids exécutables en local pour une tâche que les systèmes vidéo commerciaux de qualité professionnelle ont souvent laissée au keyframing manuel : faire exécuter à un personnage stylisé un mouvement arbitraire tout en préservant son identité. Cela pourrait faciliter l’intégration de l’animation de personnages dans les outils vidéo en aval, même si cette publication ne démontre pas à elle seule un usage généralisé en production.
La portée de cette affirmation est clairement définie. Les comparaisons rapportées placent Wan-Animate-2 aux côtés de Dreamina de ByteDance et de KLING MotionControl de Kuaishou, mais les informations disponibles ne décrivent ni tests indépendants ni déploiements par des utilisateurs. Pour l’instant, l’étape concrète est la mise à disposition d’un framework open source fonctionnant à 24 images par seconde, avec des capacités multi-personnages et multi-caméras que les développeurs peuvent évaluer en local.
Sources — lire les originaux(heure de Paris)
À lire ensuite
- Un robot apprend une compétence en 29 secondes grâce à une vidéo
- MiniMax H3 ouvre ses poids pour la vidéo-audio unifiée
- Omega-0 atteint 81,8 % sur 11 tâches domestiques
- Un robot à double bras trie 1 816 colis en une heure lors d'une démonstration en direct, avec un coût en baisse de 70 % selon des informations publiques
Commentaires
Chargement du fil…
Connectez-vous pour écrire un commentaire. Se connecter