

Écrit parMo Kahnle
Vous fixez un selfie brut, une couverture de livre à moitié finie ou une maquette de produit qui est presque prête mais pas tout à fait, et vous ne voulez pas recommencer à zéro. C'est pourquoi les gens ouvrent unéditeur d'images Stable Diffusion. Il vous permet de remodeler une partie d'une image, de changer l'ambiance ou de corriger une erreur sans tout reconstruire, ce qui explique exactement pourquoi il est devenu un flux de travail si pratique pour les créateurs qui ont besoin de rapidité et de contrôle.
La longévité du modèle repose sur une base technique conçue pour l'échelle. Stable Diffusion v1.5 a été entraîné surLAION-5B, un ensemble de données contenant5,85 milliards de paires image-texte, et son ossature U-Net compte environ860 millions de paramètres. Le système a également été conçu pour une inférence rapide, avec des temps de génération rapportés d'environ2 secondessur unGPU A100et d'environ1,5 à 5 secondessur unRTX 3090selon les paramètres et la version, ce qui aide à expliquer pourquoi les flux de travail d'édition qui reposent sur lui semblent utilisables plutôt qu'académiques (Statistiques techniques de Stable Diffusion).
Un créateur n'ouvre généralement pas unéditeur d'images Stable Diffusionparce qu'il veut « utiliser l'IA ». Il l'ouvre parce qu'une image est presque terminée, et c'est dans la dernière ligne droite que le temps s'envole. Un selfie a besoin d'une peau plus nette et d'un éclairage plus doux. Une couverture de livre a besoin d'atmosphère sans perdre en lisibilité. Une maquette de produit a besoin que le graphisme s'intègre sur la chemise sans briser le tissu ou transformer l'arrière-plan en bruit visuel.
C'est pourquoi Stable Diffusion importe en tant que surface d'édition, et pas seulement en tant que générateur. Son pipeline de diffusion fonctionne dans l'espace latent, il peut donc prendre une image existante, ajouter du bruit et reconstruire uniquement les parties que vous souhaitez modifier tout en gardant le reste intact. AWS décrit cette représentation latente comme étant48x plus petiteque une image RVB de 512×512, et que la compression est l'une des raisons pour lesquelles la boucle d'édition reste pratique pour une itération rapide (Aperçu d'AWS Stable Diffusion).
Les tâches que les gens demandent encore et encore sont prévisibles.Les selfiesont besoin d'un nettoyage du visage et des cheveux.Les couvertures de livresont besoin d'une ambiance, d'une composition et d'une finition adaptée au genre.Les produits dérivésont besoin d'un objet propre ou d'un graphisme sur une surface contrôlée.Les avatarsont besoin que leur identité soit préservée pendant que le costume, l'angle ou l'expression change.
Règle pratique :choisissez le mode d'édition en fonction de la quantité d'image que vous pouvez vous permettre de perturber, et non en fonction de la dramatisation de l'idée.
Pour une vue d'ensemble plus large de la manière dont ces outils sont packagés, leguide des outils d'IAde Shopstar constitue un bon point de départ. Si vous préférez une configuration plus légère, des plateformes telles questarryaiintègrent le téléchargement et l'édition dans un flux simple, ce qui est pratique lorsque vous ne souhaitez pas installer une pile locale ou gérer des fichiers de modèles. Pour des lectures de référence sur le modèle sous-jacent, leuraperçu de Stable Diffusionest un complément idéal pour l'édition pratique.

Le moyen le plus simple d'éviter le gaspillage de rendus est de choisir le mode approprié avant de toucher à une invite.Img2imgconserve l'intégralité de l'image et la retravaille à une intensité choisie. C'est donc le mode idéal pour le transfert de style, les reflets faciaux complets et les passes de croquis à l'image finie.L'inpaintingconserve tout ce qui se trouve à l'extérieur du masque et régénère uniquement la zone peinte, ce qui constitue le meilleur choix lorsque vous devez remplacer un visage, modifier un objet d'arrière-plan ou corriger une région spécifique.
Si vous souhaitez modifier l'ambiance de la majeure partie de l'image, utilisezimg2imgà une intensité modérée. Si vous souhaitez modifier une seule partie, peignez un masque et utilisezl'inpainting. Ce simple choix évite bien des frustrations, car le modèle ne peut pas réécrire « utilement » des parties du cadre que vous souhaitiez préserver.
Lorsque les gens se bloquent, c'est généralement parce qu'ils demandent à img2img de faire un travail chirurgical ou à l'inpainting de faire une refonte complète. Un portrait soigné avec une nouvelle coupe de cheveux peut fonctionner dans les deux cas, mais un échange de visage, un remplacement d'objet ou une correction d'arrière-plan se comporte presque toujours mieux avec un masque. La raison est simple. L'inpainting donne au modèle une limite, et les limites aident le suppresseur de bruit à se concentrer.
Gardez l'édition aussi locale que possible. Plus la région est petite, plus il est facile de préserver l'identité, la disposition et la texture.
Le même flux de travail est exposé dans des outils tels quele mode Édition de starryai, où le téléchargement et l'édition se trouvent derrière une interface simple au lieu d'une installation locale. Pour une présentation étape par étape de la plateforme, leurguide sur l'utilisation de Stable Diffusionconstitue un point de référence raisonnable si vous comparez des interfaces plutôt que de configurer votre propre environnement.

Une mauvaise préparation génère de mauvaises modifications plus rapidement qu'une mauvaise saisie. Si l'image source est bruitée, mal rognée ou éclairée par trois directions à la fois, le modèle doit trop deviner et le résultat commence à dériver. J'ai obtenu de bien meilleurs résultats lorsque je recadre serré sur le sujet, que je garde un éclairage lisible et que je évite de nourrir l'éditeur d'un cadre encombré, à moins que l'encombrement ne fasse partie du changement réel.
L'image source doit être suffisamment claire pour que le modèle puisse lire le sujet sans subir de dommages dus à la compression. Une image légèrement accentuée se comporte généralement mieux qu'une image douce et floue, et il est utile d'éliminer les artefacts évidents avant l'édition. Si vous éditez un visage ou un produit, recadrez l'image de sorte que le modèle concentre son attention sur ce que vous souhaitez modifier.
Pour les masques, la règle est tout aussi directe.Les masques au pinceausont plus contrôlables que la sélection automatique lorsque la région compte, etles bords douxse mélangent généralement mieux que les lignes de coupe nettes. Un peu de dilatation ou de flou du masque évite que la transition ne ressemble à une pièce collée, ce qui est le cas de la plupart des modifications « d'apparence IA ».
Règle pratique :commencez par le plus petit masque qui couvre encore entièrement le changement, puis estompez la frontière afin que le modèle ait de la place pour se fondre.
Pour de nombreux échanges de visages, une force de débruitage d'environ0,4 à 0,6est un point de départ judicieux, tandis qu'un restylage plus subtil nécessite généralement moins. Des forces plus élevées sont mieux réservées aux reconstructions de régions complètes, car un bruit plus fort donne au modèle l'autorisation de réécrire plus de structure. Si vous devez isoler le sujet avant de l'éditer, lesuppression d'arrière-planpage is relevant because clean separation is often half the battle.
The biggest prompt mistake in editing is mixing up what belongs to the whole image and what belongs only inside the edit region.Image-level promptsshould describe mood, lighting, camera feel, or overall style.Mask-localized promptsshould describe what needs to appear inside the painted area. If you ask the model to solve both at once, the output usually becomes vague, overcooked, or oddly literal.
| Job | Positive Prompt Skeleton | Negative Prompt |
|---|---|---|
| Selfie glow-up | clean skin, soft studio lighting, natural facial detail, subtle hair refinement, social media portrait | blurry, plastic skin, extra fingers, watermark, text |
| Cinematic book cover mockup | dramatic lighting, genre-specific atmosphere, centered subject, cover-ready composition, high contrast | random text, watermark, cluttered background, distorted face, low detail |
| Merch graphic | clean vector-like graphic, centered print area, bold contrast, isolated subject, product mockup feel | wrinkles over the design, background clutter, extra objects, watermark, text |
| Fantasy avatar portrait | detailed character portrait, balanced lighting, strong identity, costume detail, fantasy mood | broken anatomy, extra fingers, blurry face, watermark, text |
For aTikTok-style selfie glow-up, keep the prompt tight: “natural facial detail, soft glow, clean skin texture, flattering lighting, realistic hair refinement.” The negative prompt should protect identity and avoid over-smoothing: “blurry, plastic skin, extra fingers, watermark, text.” That combination pushes the editor toward enhancement instead of a completely different person.
For abook cover, the prompt should steer mood and layout, not just style words. Use language like “cinematic lighting, moody atmosphere, central subject, dramatic shadows, cover-ready composition,” then block accidental text with a negative prompt that explicitly saysrandom text. Formerch, keep the positive prompt anchored to a clean print surface, and don't forget to exclude background clutter, because design assets look worse when the editor invents detail around the graphic. For anavatar, protect the face and identity first, then add costume language second.
Negative prompts do more work in editing than in pure generation because they defend the parts you're not regenerating. The model doesn't need endless instruction. It needs a fence.
The setting that changes the output most isdenoising strength. Lower values keep structure and color closer to the source, while higher values give the model more room to rebuild the image. For editing, that makes strength the first control to adjust when the result feels too literal or too far off.
La vitesse importe car l'édition ne donne l'impression d'être itérative que lorsque le temps de traitement reste rapide. L'inférence signalée sur unGPU A100est d'environ2 secondespour une image512×512en50 steps, et unRTX 3090grand public peut gérer un travail similaire en environ1,5 à 5 secondesselon la version et les paramètres. Un résumé évalué par des pairs note également que Stable Diffusion peut fonctionner sur la plupart du matériel grand public, avec un minimum de4 Go de VRAMpour512×512une utilisation (résumé technique PMC).
Si la modification semble terne, augmentez la spécificité du prompt avant d'augmenter les étapes. Si la modification est trop littérale, réduisez d'abord le débruitage. S'il dévie, le masque ou la composition est généralement le problème, pas l'échantillonneur.
Une modification de selfie nécessite généralementl'inpaintingsur le visage et les cheveux, et non une passe img2img sur toute l'image. Gardez le masque serré autour de la peau, de la frange et de toute zone problématique, puis utilisez un débruitage modéré pour que l'expression et l'identité soient préservées. Un prompt tel que « détails faciaux naturels, éclairage doux, ligne de cheveux propre, portrait réaliste » fait mieux l'affaire qu'une accumulation d'adjectifs de style.
Une couverture de livre fonctionne mieux en tant queimg2imglorsque toute la composition a besoin de cohérence d'ambiance et de genre. Commencez par la maquette grossière, gardez la force modérée et donnez au modèle un prompt sur l'atmosphère, le placement du sujet et la finition, tandis que le prompt négatif bloque le texte aléatoire et l'encombrement. L'objectif est de faire en sorte que la couverture reste lisible en tant que couverture, et pas seulement de l'embellir.
Les produits dérivés sont généralement unbasé sur le masqueCoupez la zone imprimable, verrouillez l'arrière-plan et effectuez une retouche (inpainting) des détails graphiques ou du placement pour que le vêtement reste crédible. Si la texture de la chemise commence à se déformer autour du design, le masque est trop large ou la force est trop élevée.
Un avatar nécessite souvent une approche en deux passes. Utilisez d'abord img2img pour préserver l'identité et la pose globale, puis retouchez (inpaint) le costume ou les changements d'expression dans des zones plus petites. Cette division permet de garder le visage cohérent tout en vous permettant de faire passer le personnage dans un nouveau rôle.

La plupart des retouches ratées proviennent d'une force mal adaptée, d'un masquage faible ou d'un prompt qui en demande trop à la fois. Lorsqu'un visage se déforme, que les mains se séparent ou que le modèle ignore la zone masquée, la correction est généralement plus simple que ne le pensent les gens. J'obtiens de meilleurs résultats en réduisant légèrement la force par petits incréments qu'en réécrivant tout le prompt depuis le début.
Le contrôle de l'angle de vue est un autre point problématique. Les prompts textuels seuls échouent souvent lorsque vous avez besoin d'un angle spécifique, et c'est pourquoi les créateurs finissent par utiliser ControlNet, des cartes de profondeur, des cartes de pose ou une image de référence pour forcer la composition. Si vous essayez de garder le même sujet cohérent à travers plusieurs vues, le problème n'est pas seulement de retoucher une image, c'est de maintenir la structure pendant que la caméra bouge.
La habitude la plus sûre est de conserver le fichier d'origine et de travailler par étapes de force réduites. Relancez la retouche avec une valeur de débruitage légèrement inférieure avant de refondre le prompt, car les grands sauts ont tendance à effacer les parties que vous aimiez déjà . Le consentement explicite importe également lorsque vous modifiez le visage de quelqu'un d'autre, et les règles de la plateforme comptent une fois que l'image quitte votre éditeur. Des outils commestarryaiet des applications similaires filtrent déjà les prompts non sécurisés au niveau du système, mais la décision finale vous appartient toujours.
Le mode d'abord, le masque ensuite, le prompt en troisième, les réglages à la fin. Cet ordre fait gagner du temps car il s'attaque à la cause principale de la plupart des mauvaises retouches au lieu de traiter chaque échec comme un problème de prompt. Choisissez l'un des quatre scénarios ci-dessus, exécutez-le une fois et utilisez le résultat pour calibrer votre propre œil au lieu de passer une heure de plus à deviner.
Si vous voulez un endroit simple pour tester ces flux de travail,starryaivous offre un parcours de téléchargement et de retouche qui correspond à ce type d'itération sans configuration compliquée. Essayez un selfie, une maquette de couverture ou une passe d'avatar, puis comparez le comportement de l'inpainting et d'img2img sur vos propres images. Visitezstarryaiet commencez avec le mode de retouche qui correspond au travail que vous essayez de terminer.