Comment garder le même personnage dans une vidéo IA
Découvrez une méthode vérifiable pour garder le même personnage dans une vidéo IA, plan après plan, grâce aux références, aux ancrages et au contrôle qualité.
Published
Updated
Topic: Flux de travail des créateurs et production
La question « comment garder le même personnage dans une vidéo IA » devient essentielle dès qu’une histoire, une publicité ou un contenu social est découpé en plusieurs plans. Un visage peut légèrement changer, une veste peut prendre une autre couleur, une coiffure peut disparaître ou l’âge apparent du personnage peut varier entre deux générations. La solution la plus fiable n’est pas de demander une séquence très longue en une seule fois : il vaut mieux construire chaque plan autour d’une référence visuelle contrôlée, puis vérifier la continuité avant le montage.
Pourquoi la cohérence du personnage reste difficile
Un générateur vidéo ne conserve pas nécessairement une identité comme le ferait une équipe de tournage avec une fiche de maquillage, des costumes et une continuité supervisée. Chaque demande réinterprète plusieurs éléments en même temps : le sujet, la pose, le mouvement, la lumière, l’objectif, le décor et le style. Lorsque ces variables changent toutes à la fois, l’identité visuelle peut dériver, même si le texte semble presque identique.
Measured on TryVeo's own production render logs over the last 90 days (446 completed renders with full timing, as of 2026-09-11). Wall-clock from job start to finished file, so provider queueing is included. These are our own measurements, not vendor claims.
| Model | Median render | 90th percentile | Renders measured |
|---|---|---|---|
| veo-3.1-fast-generate-preview | 88s | 128s | 302 |
| seedance-2.0-fast | 195s | 343s | 74 |
| kling-2.5-turbo | 132s | 155s | 19 |
| seedance-2.0 | 309s | 405s | 19 |
| veo-3.1-generate-preview | 101s | 166s | 32 |
Le Face Consistency Benchmark for GenAI Video montre que plusieurs modèles vidéo ont encore des difficultés à maintenir l’apparence et les attributs d’un personnage avec une régularité comparable à celle de vidéos réelles. Cette observation invite à traiter la cohérence comme une étape de production mesurable, et non comme une propriété automatiquement garantie par un bon prompt.
Le mouvement ajoute une difficulté supplémentaire. Les travaux de NVIDIA sur les compromis entre identité et mouvement expliquent que transférer une action ou une dynamique vers un personnage peut aussi modifier involontairement ses traits. Autrement dit, une instruction comme « marche rapidement vers la caméra » ne contrôle pas uniquement la marche : elle peut influencer la silhouette, le visage, les vêtements et la posture. La méthode doit donc séparer autant que possible identité, action et décor.
1. Créer une fiche de référence avant de générer
Commencez par définir le personnage indépendamment de l’intrigue. Cette fiche devient la source de vérité utilisée pour produire l’image de référence, préparer les images d’ancrage et contrôler les résultats. Elle doit être suffisamment précise pour réduire les interprétations, mais assez courte pour rester réutilisable dans chaque demande.
- Identité visuelle : âge apparent, forme du visage, teint, couleur des yeux, coiffure et caractéristiques distinctives.
- Silhouette : taille relative, corpulence, posture habituelle et proportions visibles dans le cadre.
- Costume : vêtements précis, couleurs, matières, chaussures, accessoires et éléments qui ne doivent pas changer.
- Style d’image : rendu réaliste ou stylisé, focale apparente, contraste, palette et niveau de détail.
- Éléments variables : gestes, expressions, position dans le cadre, lumière et décor, à ne pas confondre avec l’identité.
Produisez ensuite une image de référence neutre : personnage visible en entier ou en plan américain, visage dégagé, posture naturelle, éclairage homogène et arrière-plan peu distrayant. Évitez de choisir comme référence une image où le personnage est de profil, masqué, très sombre ou fortement déformé par un mouvement. Une bonne référence ne raconte pas encore la scène ; elle décrit clairement qui doit rester reconnaissable.
2. Générer une image d’ancrage pour chaque plan
L’image d’ancrage sert de pont entre la fiche de référence et la vidéo. Pour chaque plan, préparez une image fixe qui montre le personnage dans la composition exacte souhaitée : angle de caméra, distance, direction du regard, costume, décor et position de départ. Cette étape permet de corriger un visage ou une tenue avant de consommer du temps de génération vidéo.
Une étude consacrée à un pipeline de récits vidéo constate que la suppression du mécanisme d’ancrage visuel fait passer le score de cohérence des personnages de 7.99 à 0.55. Ces valeurs appartiennent au protocole de cette étude et ne constituent pas une garantie applicable à tous les modèles, mais elles illustrent l’importance pratique d’un repère visuel explicite. Consultez l’étude sur le pipeline multistade pour le contexte expérimental.
- Décrivez le plan : action principale, cadrage, mouvement de caméra et durée visée.
- Réutilisez la fiche du personnage sans réécrire ses attributs de façon contradictoire.
- Créez une image d’ancrage qui combine le personnage et la composition du plan.
- Vérifiez cette image avant de lancer la vidéo : visage, cheveux, vêtements, accessoires, silhouette et direction du regard.
- Générez le plan à partir de cette image, puis conservez la dernière image réellement utilisable.
- Utilisez cette dernière image comme point de départ du plan suivant lorsque la continuité temporelle le justifie.
La dernière image du plan précédent est particulièrement utile pour une action continue : une personne qui se lève, ouvre une porte ou traverse un couloir. Elle transmet la posture, l’orientation et l’état du costume au plan suivant. En revanche, pour une ellipse narrative ou un changement de lieu, gardez la fiche de référence comme autorité principale et créez une nouvelle image d’ancrage adaptée au décor. La continuité ne signifie pas qu’il faut copier chaque pixel ; elle signifie que les attributs qui doivent rester stables sont surveillés.
3. Séparer identité, mouvement et décor dans le brief
Un brief efficace distingue clairement ce qui est verrouillé de ce qui peut évoluer. Réservez un bloc à l’identité, un bloc à l’action, un bloc à la caméra et un bloc à l’environnement. Cette organisation ne supprime pas les limites du modèle, mais elle facilite le diagnostic lorsqu’un résultat échoue.
Grille qualitative de préparation inspirée des limites d’identité et de mouvement décrites par les travaux cités.
| Bloc du brief | À maintenir | À faire varier | Contrôle après génération |
|---|---|---|---|
| Identité | Visage, cheveux, âge apparent, silhouette | Expression légère et orientation | Comparaison avec la référence |
| Costume | Couleurs, matières, accessoires | Plis et position naturelle | Détection des changements visibles |
| Mouvement | Point de départ et intention de l’action | Vitesse, geste, déplacement | Vérification de l’action sans dérive du visage |
| Décor et caméra | Contraintes nécessaires à la continuité | Lieu, lumière, cadrage et trajectoire | Contrôle de la transition avec le plan voisin |
Sources: NVIDIA Research
Dans le brief, placez les éléments d’identité avant l’action et répétez uniquement les attributs critiques. Par exemple : « même personnage que sur l’image de référence, visage ovale, cheveux bruns courts, veste en toile vert foncé, écharpe beige ». Ajoutez ensuite : « il se tourne lentement vers la fenêtre, caméra fixe, lumière de fin d’après-midi ». Cette séparation réduit l’ambiguïté entre ce que le modèle doit préserver et ce qu’il doit animer.
Pour préparer vos images, vous pouvez consulter la page Image de TryVeo, puis utiliser le mode vidéo le plus adapté à votre étape, comme la génération à partir d’une image ou la continuation vidéo. La liste des types de génération actifs comprend notamment Image to Video, Video Continuation et Reference-Guided Video. Choisissez l’option en fonction de la relation recherchée entre votre référence, votre ancrage et le plan à produire, plutôt que de changer de méthode au hasard.
4. Contrôler chaque plan avant le montage
Ne jugez pas uniquement la première image ou une image spectaculaire. Regardez le plan entier, puis comparez-le au plan précédent et au suivant. Les dérives apparaissent parfois au milieu d’un mouvement : un accessoire se transforme, une mèche change de place, une manche se dédouble ou le visage devient moins reconnaissable pendant un virage.
- Identité : les traits principaux du visage, la coiffure et l’âge apparent restent-ils compatibles avec la référence ?
- Vêtements : les couleurs, la coupe, les matières et les accessoires sont-ils conservés ?
- Corps : la silhouette, les proportions et le nombre de membres restent-ils cohérents pendant l’action ?
- Mouvement : le geste est-il lisible sans provoquer une transformation du personnage ?
- Décor : les éléments qui doivent assurer la continuité sont-ils présents et correctement orientés ?
- Raccord : la dernière image du plan s’enchaîne-t-elle avec la première image du suivant ?
- Artefacts : voyez-vous des visages instables, des mains déformées, des objets fusionnés ou des changements de texture ?
Attribuez à chaque plan un statut simple : accepté, à corriger ou à régénérer. Si l’identité est bonne mais que le mouvement est mauvais, ne réécrivez pas toute la description du personnage. Conservez l’image d’ancrage et modifiez seulement l’action ou la caméra. Si le visage est incorrect dès la première image, revenez à l’image d’ancrage plutôt que d’espérer qu’il se stabilise pendant la vidéo.
Un modèle de brief réutilisable dans votre production
Personnage : même personnage que sur l’image de référence. Identité verrouillée : [visage, cheveux, âge apparent]. Costume verrouillé : [vêtements, couleurs, accessoires]. Plan : [cadrage et position]. Action uniquement : [geste ou déplacement]. Caméra : [fixe, panoramique ou travelling]. Décor : [éléments nécessaires]. Continuité : conserver la silhouette, le visage, la tenue et les accessoires ; ne pas ajouter de personnage ni modifier l’apparence.
Ce modèle fonctionne mieux si chaque crochet contient une information observable plutôt qu’une intention vague. Remplacez « personnage élégant » par des détails visibles, et « mouvement cinématographique » par une action précise. Pour une histoire plus longue, notre guide Comment créer une vidéo IA longue : guide pratique peut compléter cette méthode sur le découpage, les raccords et l’organisation des plans.
En résumé, garder le même personnage dans une vidéo IA repose moins sur une formule magique que sur une chaîne de vérifications : fiche de référence, image d’ancrage par plan, réutilisation raisonnée de la dernière image, séparation de l’identité et du mouvement, puis contrôle avant montage. Les recherches disponibles montrent que la cohérence reste une limite réelle des modèles actuels. En traitant chaque plan comme une unité contrôlable, vous réduisez les erreurs difficiles à repérer et vous rendez les régénérations plus ciblées.
Sources
- Face Consistency Benchmark for GenAI Video, arXiv — Current AI models often struggle to maintain coherence in character appearance and attributes when generating videos.
- Lights, Camera, Consistency: A Multistage Pipeline for Character-Stable AI Video Stories, arXiv — removing the visual anchoring mechanism results in a catastrophic drop in character consistency scores (from 7.99 to 0.55)
- Identity-Motion Trade-offs in Text-to-Video Generation, NVIDIA Research — making it hard to transfer motion without the side-effect of transferring identity.