Les deux versions sont alignées bloc par bloc, dans l’ordre du texte : titre, l’essentiel, puis paragraphe par paragraphe. Quand la traduction a fusionné ou scindé un paragraphe, la case correspondante reste vide — on ne rapproche jamais deux passages au jugé.
A character animation system that once needed a skeletal rig now takes the driving video as it is. Alibaba’s Tongyi Wanxiang team has released Wan-Animate-2 as open source, and the framework streams at 24 frames per second while producing results that head-to-head tests found competitive with closed commercial tools.
Un système d’animation de personnages qui nécessitait autrefois un squelette prend désormais directement la vidéo de pilotage telle quelle. L’équipe Tongyi Wanxiang d’Alibaba a publié Wan-Animate-2 en open source, et le framework diffuse à 24 images par seconde tout en produisant des résultats jugés compétitifs face à des outils commerciaux fermés lors de tests comparatifs.
The change happens before the animation is rendered. Older pipelines extracted a character’s pose from the driving footage, then compressed the motion into features for the model to use. Wan-Animate-2 skips both steps: the raw pixels go directly into a diffusion Transformer, a generative model that learns how the driving performance maps onto the target character. Pandaily reports cleaner hand deformation and fewer limb artifacts on challenging movements.
Le changement intervient avant le rendu de l’animation. Les anciens pipelines extrayaient la pose d’un personnage depuis la vidéo de pilotage, puis compressaient le mouvement en caractéristiques destinées au modèle. Wan-Animate-2 évite ces deux étapes : les pixels bruts sont injectés directement dans un Transformer de diffusion, un modèle génératif qui apprend comment transposer la performance de pilotage sur le personnage cible. Pandaily fait état de déformations plus nettes des mains et de moins d’artefacts sur les membres lors de mouvements complexes.
The framework is not limited to one character or one viewpoint. A single driving video can animate several target characters at once, while the same performance can be rendered from multiple explicit camera positions without retraining. It also handles non-standard aspect ratios and varied character body types, areas where open-source character animation systems have often been brittle.
Le framework ne se limite pas à un personnage ou à un point de vue. Une seule vidéo de pilotage peut animer plusieurs personnages cibles à la fois, tandis que la même performance peut être rendue depuis plusieurs positions de caméra explicites sans réentraînement. Il gère également les rapports d’aspect non standard et différentes morphologies de personnages, des domaines dans lesquels les systèmes d’animation de personnages open source se sont souvent montrés fragiles.
So what changes in practice? Developers and creators can access locally runnable weights for a task that commercial-grade AI video systems have often left to manual keyframing: making a stylized character perform arbitrary motion while preserving its identity. That could make character animation easier to integrate into downstream video tools, although the release itself does not establish broad production use.
Qu’est-ce que cela change en pratique ? Les développeurs et les créateurs peuvent accéder à des poids exécutables en local pour une tâche que les systèmes vidéo commerciaux de qualité professionnelle ont souvent laissée au keyframing manuel : faire exécuter à un personnage stylisé un mouvement arbitraire tout en préservant son identité. Cela pourrait faciliter l’intégration de l’animation de personnages dans les outils vidéo en aval, même si cette publication ne démontre pas à elle seule un usage généralisé en production.
The claim has a clear boundary. The reported comparisons place Wan-Animate-2 alongside ByteDance’s Dreamina and Kuaishou’s KLING MotionControl, but the available account does not describe independent testing or user deployments. For now, the concrete milestone is an open-source framework operating at 24 frames per second, with multi-character and multi-camera capabilities ready for developers to evaluate locally.
La portée de cette affirmation est clairement définie. Les comparaisons rapportées placent Wan-Animate-2 aux côtés de Dreamina de ByteDance et de KLING MotionControl de Kuaishou, mais les informations disponibles ne décrivent ni tests indépendants ni déploiements par des utilisateurs. Pour l’instant, l’étape concrète est la mise à disposition d’un framework open source fonctionnant à 24 images par seconde, avec des capacités multi-personnages et multi-caméras que les développeurs peuvent évaluer en local.