

Écrit parMo Kahnle
Vous générez un portrait de héros qui semble achevé. La mâchoire est parfaite, les yeux verts sont inimitables et la cicatrisation se trouve exactement là où elle doit être. Ensuite, vous demandez le même aventurier dans une ruelle détrempée par la pluie, et le visage s'adoucit, la couleur des cheveux change, le costume mute et la cicatrisation disparaît. L'image suivante est belle en soi, mais elle n'appartient plus au même personnage.
C'est le problème de l'IA de génération de personnages cohérents. La première image est rarement la plus difficile. Le défi de production commence lorsqu'un personnage doit survivre à de nouvelles poses, tenues, configurations d'éclairage, angles de caméra, panneaux, formats de produits et éventuellement à la vidéo. Le prompting a son importance, mais un résultat fiable provient de la combinaison de références, de la génération contrôlée, de l'édition et de la mesure.
Une belle première image peut créer un faux sentiment de confiance. Vous voyez un visage convaincant et supposez que le modèle a appris à connaître votre personnage. Dans la plupart des flux de texte-vers-image ordinaires, ce n'est pas le cas. Il a interprété une invite et échantillonné un résultat visuellement cohérent à partir d'un vaste espace de possibilités.

La deuxième invite ajoute une pose, un emplacement, une météo, un objectif, un ajustement vestimentaire et une ambiance. Ces nouvelles instructions entrent en compétition avec les descripteurs d'identité. Le modèle ne possède pas de mémoire fiable du portrait précédent, il reconstruit donc le personnage à nouveau. Des concepts similaires peuvent s'interpoler dans l'espace latent, mais l'interpolation n'est pas la même chose que la préservation d'une personne spécifique. Un « aventurier fantastique robuste » peut rester stylistiquement correct tout en perdant le nez exact, l'espacement des yeux ou la cicatrice qui rendait l'original reconnaissable.
Les créateurs réagissent souvent en ajoutant plus de descriptions. Cela aide jusqu'à un certain point. Une fois qu'une invite est encombrée d'informations sur la scène, les jetons d'identité peuvent perdre de leur influence. Le visage peut être décrit techniquement, mais le modèle accorde plus de poids visuel à l'éclairage dramatique, à la pose d'action, à la cape, au brouillard ou à l'environnement.
Il s'agit de la dilution des jetons en termes pratiques. L'invite contient toujours « yeux verts » et « cicatrice faciale », mais ces détails peuvent ne pas survivre à une nouvelle composition. Une cicatrice est particulièrement vulnérable car elle occupe une petite région, tandis que l'éclairage et les cheveux affectent de grandes zones visuelles.
Règle pratique :Traitez chaque nouvelle génération comme une nouvelle décision de casting, à moins que votre flux de travail ne fournisse une ancre d'identité.
La recherche publiée dans2023a identifié cette limitation directement. Les travaux sur lespersonnages cohérents dans les modèles de diffusion texte-vers-imageont décrit une approche entièrement automatisée et textuelle pour générer le même personnage spécifique sans images de référence. Elle a également défini la préservation de l'identité à travers les scènes, les tenues et les invites comme un problème fondamental plutôt que comme un problème mineur de réglage des invites.
Cette distinction change votre façon de travailler. Au lieu de vous demander pourquoi une invite a échoué, demandez quelle partie du pipeline est responsable de l'identité. Votre ensemble de références, la personnalisation du modèle, la stratégie de graine (seed), le contrôle des poses et la post-production ont chacun besoin d'un rôle défini. Un aperçu utile desflux de travail de personnages cohérents dans Midjourneypeut vous aider à comparer le comportement des plateformes, mais aucune invite unique ne peut créer une mémoire persistante là où le système de génération n'en a pas.
Un ensemble d'images de référence doit décrire le personnage de manière plus fiable qu'un simple texte. Commencez par rassembler8 à 15 imagesqui montrent une seule identité sous des angles utiles, comme indiqué dans le dossier de travail fourni. Ne remplissez pas l'ensemble avec quinze portraits de beauté presque identiques. La variation aide le système à séparer la structure faciale d'un éclairage, d'un cadrage ou d'une expression particulière.
Votre meilleur groupe de départ comprend :

Créez une liste de contrôle des traits avant de générer des scènes en aval. Écrivez « yeux verts étroits en amande » uniquement si c'est ce que vous pouvez défendre à travers les références approuvées. Notez si la mâchoire est large, effilée, anguleuse ou douce. Notez l'arête et le bout du nez, la forme de la bouche, la ligne des cheveux, les poils du visage, la position de la cicatrice et toute asymétrie. Pour les vêtements, séparez les traits d'identité de la garde-robe facultative. Un pendentif en cuivre peut être un accessoire signature, tandis qu'une veste marron peut être un simple costume.
Recadrez les images pour que le visage et le corps reçoivent plus d'attention que le décor non pertinent. Gardez le personnage assez grand pour que les traits du visage restent lisibles, mais ne recadrez pas chaque image de manière identique. Le bruit de fond, la correction des couleurs dramatique et les motifs de costumes contradictoires peuvent enseigner la mauvaise leçon au modèle.
Les graines fixes sont utiles lors de la production d'un ensemble de base contrôlé, car elles réduisent les variations inutiles pendant que vous affinez le design. Pour une couverture plus large, transplanter le visage approuvé sur différentes poses peut aider, mais les échanges de visages laissent souvent des textures de peau, des bords de cheveux, des oreilles ou des éclairages mal assortis. Corrigez ces erreurs manuellement dans Photoshop ou Krita avant de traiter l'image comme une référence.
Utilisez un système de collecte qui préserve les originaux approuvés, les brouillons rejetés, le texte de l'invite (prompt), la graine (seed), le nom du modèle et l'historique d'édition.La gestion de collection pour les actifs IAest particulièrement utile lorsqu'un personnage passe d'un simple portrait à une bibliothèque de planches, de couvertures, d'avatars et de produits dérivés.
L'ensemble de référence ne doit pas être un dossier aléatoire de résultats attrayants. C'est une bibliothèque d'identité contrôlée. Si deux images sont en désaccord sur la couleur des yeux ou l'emplacement de la cicatrice, supprimez-en une ou réparez-la avant que la contradiction ne se propage aux générations futures.
L'ingénierie des invites fonctionne mieux lorsqu'elle séparel'identité, l'action, l'environnement, etle style de rendu. Placez d'abord la description déterminante du personnage, puis décrivez la pose et la scène. Cet ordre ne force pas le modèle à obéir à chaque détail, mais il donne à l'identité une position plus claire dans la hiérarchie des invites.
Une base stable pourrait être : « beau aventurier fantastique, mâchoire anguleuse, yeux verts étroits, cheveux sombres et ondulés, cicatrice diagonale sur le sourcil gauche, manteau en cuir vieilli ». Ajoutez ensuite « portrait de trois quarts, debout dans une ruelle détrempée par la pluie ». Si le visage commence à dériver, supprimez d'abord les modificateurs d'environnement et de style. N'ajoutez pas immédiatement plus d'adjectifs.
La syntaxe pondérée peut renforcer une caractéristique faible, telle que(sharp jawline:1.3), lorsque le modèle ou l'interface le prend en charge. Utilisez les poids avec précaution. Surexagérer une caractéristique peut produire une caricature, et un visage est une relation entre des repères, et non une pile d'étiquettes isolées. Les invites négatives peuvent supprimer des mutations évidentes, mais elles ne remplaceront pas une image de référence ou une représentation d'identité entraînée.
La même invite de personnage peut se comporter différemment selon la scène. Un portrait neutre donne au modèle la liberté d'allouer de l'attention à la structure faciale. Une photo d'action en pied lui demande de résoudre à la fois l'anatomie, les mains, les vêtements, la perspective, l'éclairage, l'environnement et l'identité.
| Modèle d'invite | Stabilité de l'identité | Flexibilité de la scène | Meilleur cas d'utilisation |
|---|---|---|---|
| Description de l'identité uniquement | Élevée | Faible | Création de la référence principale |
| Identité plus pose simple | Élevée | Modérée | Turnarounds et planches d'expression |
| Identité plus environnement contrôlé | Modérée | Élevée | Planches de storyboard et concepts de couverture |
| Invite de scène cinématique dense | Faible à modérée | Très élevée | Images exploratoires, pas de continuité définitive |
| Image de référence plus instruction concise | Le plus élevé parmi les flux de travail ordinaires | Élevée | Réutilisation d'un personnage approuvé dans de nouvelles scènes |
Les graines aident, mais elles sont souvent mal comprises. Verrouillez une graine lorsque vous explorez des changements de pose ou de composition proches et que vous souhaitez une certaine cohérence structurelle. Faites pivoter les graines lorsque vous avez besoin d'une véritable diversité. Une graine peut préserver certains aspects d'une composition tout en permettant à la géométrie faciale de changer, ce n'est donc pas un identifiant de personnage en soi.
Conservez un journal de génération avec l'instruction complète, l'instruction négative, la graine, l'échantillonneur ou les paramètres équivalents, la version du modèle, l'image de référence et tout poids d'adaptateur. Unguide de conception d'instructions pour débutantspratique est utile pour apprendre la syntaxe, mais la cohérence de production dépend davantage d'une comparaison disciplinée que d'une formulation de plus en plus élaborée.
L'étape de recherche de 2023a également documenté un compromis significatif entre la cohérence de l'identité et la similarité des instructions. Les approches basées sur LoRA ont permis une plus grande cohérence de l'identité tout en sacrifiant un peu d'alignement avec l'instruction, tandis que les approches de type inversion de texte et BLIP-diffusion ont eu tendance à mieux préserver la sémantique de l'instruction mais ont conservé l'identité de manière moins fiable. Ce compromis est toujours visible dans le travail quotidien. Plus de liberté créative donne généralement au modèle plus d'opportunités de réinterpréter le visage.
La personnalisation de modèle transforme le problème de l'identité, passant de « décrivez à nouveau cette personne » à « donnez au modèle une représentation réutilisable de cette personne ». Les trois options courantes ont des coûts et des modes de défaillance différents. Leurs exigences pratiques varient selon le modèle de base et la configuration d'entraînement, de sorte que les chiffres ci-dessous doivent être traités comme les plages de fonctionnement du flux de travail fourni, et non comme des garanties universelles.
| Méthode | Taille du fichier | VRAM requise | Images d'entraînement | Idéal pour | Limitation principale |
|---|---|---|---|---|---|
| Embeddings, ou inversion textuelle | 4 à 8 Ko | Non spécifié dans les données vérifiées | 3 à 5 | Traits de style simples et concepts compacts | Souvent faible avec les visages complexes et les vêtements |
| LoRA | 50 à 300 Mo | 8 à 12 Go | 10 à 20 | Identité complète du personnage dans des scènes variées | Peut troquer la flexibilité des instructions contre la force de l'identité |
| DreamBooth | Non spécifié dans les données vérifiées | 24 Go ou plus | 20 à 50 | Reproduction de propriété intellectuelle commerciale haute fidélité | Entraînement plus long et risque de surapprentissage |
Un embedding, souvent appelé inversion textuelle, entraîne un vecteur de jeton que vous insérez dans les instructions. Sa taille compacte le rend pratique à partager et à versionner. Il peut bien fonctionner pour un indice de style reconnaissable, un traitement des couleurs ou un concept visuel simple.
Il est moins fiable lorsque la cible comprend une géométrie faciale complexe, des vêtements distinctifs, des accessoires et des poses changeantes. Le jeton peut évoquer l'idée générale sans préserver le personnage complet. Il hérite également des faiblesses du modèle de base, de sorte qu'un embedding entraîné pour une famille de modèles peut ne pas se transférer proprement à une autre.
LoRA, ou Low-Rank Adaptation, modifie le comportement d'attention grâce à un adaptateur léger plutôt qu'en remplaçant l'ensemble du modèle de base. Pour les bandes dessinées indépendantes et les produits dérivés, cet équilibre est souvent utile. Un ensemble de données de10 à 20 imageset uneVRAM déclarée de 8 à 12 Gopeuvent s'intégrer dans de nombreux flux de travail de créateurs, bien que les résultats dépendent fortement des légendes, de la qualité des images et des paramètres d'entraînement.
Le principal mode de défaillance est le surapprentissage. Un LoRA entraîné de manière trop agressive peut reproduire la même expression, le même angle de caméra, le même costume ou le même arrière-plan au lieu d'apprendre l'identité sous-jacente. Un sous-entraînement crée le problème inverse, une vague ressemblance qui s'effondre dès que la scène change.
DreamBooth affine le modèle global autour du sujet. Le flux de travail fourni spécifie20 à 50 images d'entraînementet24 Go ou plus de VRAM, avec des exigences d'entraînement plus longues que les approches plus légères. Il peut être approprié lorsqu'une propriété intellectuelle commerciale nécessite une reproduction très fidèle dans le cadre d'un pipeline contrôlé.
Le surapprentissage est le danger. Le personnage peut s'infiltrer dans des instructions non liées, répéter la garde-robe d'entraînement ou devenir difficile à séparer de l'arrière-plan et du style. Utilisez-le lorsque la fidélité justifie la charge opérationnelle, et non parce qu'une méthode d'entraînement plus vaste produit automatiquement de meilleurs actifs de narration.
L'Étude Character-Adapter de 2024a rapporté uneamélioration de 24,8%par rapport aux méthodes antérieures sur les scores de cohérence des personnages CLIP-I et DINO, ainsi qu'uneefficacité computationnelle supérieure à 70xpar rapport aux approches basées sur le fine-tuning, car elle ne nécessitait aucun entraînement supplémentaire, selon ledocument Character-Adapter publié. Ce résultat renforce la règle de décision générale : un adaptateur spécialisé peut s'avérer plus efficace que de tout réentraîner, mais les gains sur les benchmarks ne dispensent pas d'inspecter soi-même les visages, les vêtements, les mains et le comportement des scènes.
Le pipeline de production le plus fiable traite la génération comme un processus par couches. Commencez par une image de base neutre, et non par une scène finale ambitieuse. Une vue aux trois quarts ou une pose en T neutre vous offre une plaque de référence dotée d'une structure faciale lisible, de limites de costumes, de mains et d'une silhouette claire.
Enregistrez cette plaque de référence avec son prompt, sa seed, son modèle, son jeu de références et sa version de personnalisation. Chaque plan ultérieur doit pouvoir y être rattaché. Si la plaque de référence présente une boucle d'oreille tordue ou une cicatrice incohérente, corrigez cela avant de créer d'autres ressources.
Pour les changements de tenue, masquez les zones vestimentaires et laissez intacts le visage, les mains, la ligne des cheveux, les bijoux et les autres zones critiques pour l'identité. Inpainter l'intégralité du personnage peut produire un résultat plus soigné, mais cela donne également au modèle la liberté de recréer le personnage. Les masques de petite taille sont plus lents et plus sûrs.
Le transfert de pose de type ControlNet permet de placer un personnage dans une nouvelle posture en utilisant un squelette OpenPose extrait d'une photographie ou d'un mannequin 3D. Maintenez la description de l'identité et l'image de référence stables pendant que la pose change. Si le visage se dégrade, générez d'abord une pose plus simple et ré Réparez le corps ensuite plutôt que de demander à une seule passe de résoudre tous les problèmes.
Générez l'arrière-plan, le personnage et les éléments de premier plan séparément lorsque la scène comporte des perspectives complexes, des accessoires ou des effets atmosphériques. Assemblez-les dans Photoshop ou Krita, puis retouchez les raccords, les ombres de contact, les contours des cheveux et les mains. Cette approche vous donne le contrôle sur les parties que les modèles ont tendance à fusionner ou à déformer.
La continuité de la garde-robe mérite sa propre feuille de référence. Notez les noms des vêtements, les matières, les motifs, l'emplacement des accessoires et les valeurs de couleur clés. Les codes hexadécimaux ne garantissent pas un rendu parfait, mais ils vous offrent une cible de correction concrète lorsqu'une veste passe progressivement du bleu marine au teal.
La variation par lots est utile tant que la configuration fonctionne. Générez20 à 30 imagesprésentant de légères modifications d'angle, d'éclairage ou d'expression au cours d'une même session, comme spécifié dans le flux de production. Sauvegardez immédiatement les meilleurs résultats. Recréer une combinaison réussie quelques jours plus tard peut s'avérer impossible car le modèle, les paramètres ou le contexte de référence ont changé.
Protégez le visage, modifiez une seule variable à la fois et confiez la responsabilité de la continuité à l'éditeur plutôt que de demander au générateur de résoudre l'intégralité du plan.
« Cela me paraît correct » est un piètre système de validation. Une seule image peut sembler convaincante tandis qu'une grille révèle que la mâchoire, l'espacement des yeux, la ligne des cheveux et la cicatrice bougent d'une image à l'autre. La cohérence nécessite un test reproductible, en particulier lorsqu'un actif visuel apparaîtra dans une bande dessinée, une planche d'autocollants, une chemise ou une séquence.
Disposez10 à 15 images généréesdans une grille et visualisez-les rapidement, en suivant le flux de travail de type flipbook fourni. L'inspection statique incite à pardonner chaque image séparément. Le visionnage rapide en séquence révèle que le personnage change d'identité d'une image à l'autre.
Comparez ensuite les repères faciaux. Utilisez un outil de reconnaissance faciale ou des guides manuels dans Photoshop pour inspecter la distance inter-pupillaire, le rapport largeur/hauteur du visage et les proportions entre le nez et le menton. Le flux de travail fourni traite toute variation supérieure à5 à 8%comme un échec de cohérence, mais la mesure des repères doit rester un outil de filtrage plutôt qu'un substitut au jugement artistique.

Demandez à une personne étrangère au projet d'identifier quelles images représentent la même personne. S'ils hésitent sur plus de20%des images, le verrouillage de l'identité doit être amélioré, selon la méthode d'évaluation fournie. Ce test permet de détecter la dérive que vous avez apprise à ignorer à force d'avoir fixé le personnage trop longtemps.
Imprimez et mettez à l'échelle le personnage dans des contextes réalistes. Placez les images sur des modèles de t-shirts, des planches d'autocollants et des planches de bande dessinée. L'affichage en miniature peut masquer de petites différences, tandis que la résolution d'impression met en évidence une cicatrice qui disparaît, une couleur d'yeux discordante ou un emplacement d'oreille instable.
Notez chaque image approuvée de1 à 5pour la structure du visage, le respect de la palette de couleurs, la préservation des traits distinctifs et la reconnaissance d'une pose à l'autre. Calculez la moyenne des catégories et écartez de la production tout ce qui se trouve en dessous de3.5jusqu'à ce que vous ré-entraîniez, remaciez la référence ou répariez la zone fragile. Le principe derrière ce type d'évaluation est soutenu parCharacterBench, qui utilise22 859 échantillons annotés par des humains, 3 956 caractères, et25 catégories de personnages détailléespour évaluer la cohérence sur des types de personnages plus larges plutôt que sur un style de visage unique et privilégié.
Unethèse distincte sur la cohérence des personnages dans Fluxa proposé d'utiliser DeepFace, CLIP et LPIPS dans un cadre d'évaluation formel. C'est un correctif utile à la pensée axée uniquement sur les prompts. Un meilleur libellé peut aider, mais une identité mesurable exige des références, des contrôles et une révision.
Un système de personnages prêt pour la production commence par le nommage, pas par le rendu. Utilisez des noms de fichiers qui enregistrent le personnage, la scène, le plan, la seed, le modèle, la version du LoRA et le statut de révision. Stockez le prompt et le chemin de référence dans les métadonnées ou dans un journal associé afin de pouvoir rouvrir un projet des mois plus tard sans deviner quelle combinaison a créé le visage validé.
Conservez des dossiers séparés pour les références principales, les images d'entraînement, les candidats générés, les plaques approuvées, les modifications et les exportations finales. Versionnez vos LoRAs et descriptions de personnages au lieu de les écraser. Lorsqu'une suite ou un lancement de produits dérivés met en évidence une faiblesse, vous saurez si la cause provient d'un nouveau modèle, d'un prompt modifié, d'un adaptateur différent ou d'une mauvaise référence.
Pour les webcomics, exportez des fichiers PNG compressés avec un profil ICC intégré lorsque votre flux de publication le prend en charge. Pour les produits dérivés à la demande, préparez desTIFFs à 300 DPIavec des marges de coupe perdues si le fournisseur l'exige. Les développeurs de jeux doivent créer des sprites prêts à l'emploi dotés de canaux alpha, tandis que les créateurs de contenu social peuvent avoir besoin de fichiers plus légers et de formats d'image cohérents pour les modèles de plate-forme.
Le format ne répare pas la dérive d'identité. Il préserve ou expose les décisions que vous avez déjà prises ; examinez donc le personnage à la taille et dans le contexte où le public le découvrira.
Les artistes de bande dessinée indépendants peuvent bénéficier de scripts de génération par lots qui maintiennent les graines et les blocs de invites stables d'une case à l'autre. Les concepteurs de produits dérivés doivent tenir à jour des feuilles de rotation avec un éclairage cohérent, des vues de face, de dos et de trois quarts. Les équipes de jeux ont besoin de détourages propres avec canal alpha et de conventions de nommage qui survivent au transfert entre le concept, l'interface utilisateur et l'implémentation.
Pour les créateurs qui transforment une bibliothèque de personnages en une entreprise plus vaste, ces habitudes opérationnelles s'ajoutent à de plus largesressources pour hackers indépendantsqui peuvent aider pour la partie non artistique de la livraison. Le principe créatif reste simple :la cohérence est un système, pas un simple prompt. Les artistes qui terminent des projets complets construisent l'échafaudage avant d'en avoir besoin.
starryai propose une génération de personnages basée sur du texte et des flux de travail qui peuvent utiliser des photos de référence téléchargées pour créer des avatars personnalisés et des visuels de personnages répétés. Si vous construisez une bibliothèque de référence pour des bandes dessinées, des produits dérivés ou du contenu pour les réseaux sociaux, visitezstarryaipour tester des concepts de personnages et développer un pipeline d'images reproductible.