

Verfasst vonMo Kahnam
Sie starren auf ein rohes Selfie, ein halbfertiges Buchcover oder ein Merchandise-Mockup, das fast, aber noch nicht ganz stimmig ist, und Sie möchten nicht komplett von vorne anfangen. Genau das ist der Grund, warum Menschen einenStable Diffusion-Bildbearbeiteröffnen. Er gibt Ihnen die Möglichkeit, einen Teil eines Bildes neu zu gestalten, die Stimmung zu verĂ€ndern oder einen Fehler zu korrigieren, ohne das Ganze noch einmal aufzubauen. Das ist genau der Grund, warum er zu einem so praktischen Arbeitsablauf fĂŒr Kreative geworden ist, die Geschwindigkeit und Kontrolle brauchen.
Die Langlebigkeit des Modells basiert auf einem technischen Fundament, das auf Skalierbarkeit ausgelegt ist. Stable Diffusion v1.5 wurde aufLAION-5Btrainiert, einem Datensatz mit5,85 Milliarden Bild-Text-Paaren, und sein U-Net-R RĂŒckgrat verfĂŒgt ĂŒber etwa860 Millionen Parameter. Das System wurde zudem fĂŒr schnelle Inferenz konzipiert, mit gemeldeten Generierungszeiten von etwa2 Sekundenauf einerA100 GPUund grob1,5 bis 5 Sekundenauf einerRTX 3090je nach Einstellungen und Version. Dies erklĂ€rt, darauf basierende Bearbeitungs-Workflows eher nutzbar als akademisch wirken (Technische Statistiken zu Stable Diffusion).
Ein Kreativer öffnet in der Regel keinenStable Diffusion-Bildbearbeiter, weil er unbedingt âKI nutzenâ möchte. Er öffnet ihn, weil ein Bild fast fertig ist und die letzte Strecke die meiste Zeit verschlingt. Ein Selfie braucht reinere Haut und weicheres Licht. Ein Buchcover braucht AtmosphĂ€re, ohne an Lesbarkeit zu verlieren. Ein Merchandise-Mockup erfordert, dass die Grafik auf dem Shirt sitzt, ohne den Stoff zu beschĂ€digen oder den Hintergrund in visuelles Rauschen zu verwandeln.
Deshalb ist Stable Diffusion als BearbeitungsflĂ€che wichtig und nicht nur als Generator. Seine Diffusions-Pipeline arbeitet im latenten Raum, sodass sie ein bestehendes Bild nehmen, Rauschen hinzufĂŒgen und nur die Teile neu aufbauen kann, die Sie Ă€ndern möchten, wĂ€hrend der Rest intakt bleibt. AWS beschreibt diese latente ReprĂ€sentation als48x kleinerals ein 512Ă512 RGB-Bild, und diese Komprimierung ist ein Grund, warum die Bearbeitungsschleife fĂŒr schnelle Iterationen praktisch bleibt (AWS Stable Diffusion-Ăbersicht).
Die Aufgaben, nach denen die Leute immer wieder fragen, sind vorhersehbar.Selfiesbrauchen eine Gesichts- und Haarkorrektur.Buchcoverbrauchen Stimmung, Komposition und ein genre-gerechtes Finish.Merchbraucht ein sauberes Objekt oder eine Grafik auf einer kontrollierten OberflĂ€che.AvataremĂŒssen ihre IdentitĂ€t behalten, wĂ€hrend sich KostĂŒm, Winkel oder Ausdruck verĂ€ndern.
Praxisregel:WÀhlen Sie den Bearbeitungsmodus danach aus, wie viel vom Bild Sie zu verÀndern bereit sind, und nicht danach, wie dramatisch die Idee klingt.
FĂŒr eine breitere Ăbersicht darĂŒber, wie diese Tools verpackt sind, ist derLeitfaden zu KI-Toolsvon Shopstar ein nĂŒtzlicher Hintergrund. Wenn Sie ein leichteres Setup bevorzugen, verpacken Plattformen wiestarryaidas Hochladen und Bearbeiten in einen einfachen Ablauf, was praktisch ist, wenn Sie keinen lokalen Stack installieren oder Modelldateien verwalten möchten. Als HintergrundlektĂŒre zum zugrunde liegenden Modell ist derenStable Diffusion-Ăbersichteine saubere ErgĂ€nzung zur praktischen Bearbeitung.

Der einfachste Weg, verschwendete Renderings zu vermeiden, besteht darin, den richtigen Modus zu wĂ€hlen, bevor Sie einen Prompt berĂŒhren.Img2imgbehĂ€lt das gesamte Bild bei und ĂŒberarbeitet es mit einer gewĂ€hlten StĂ€rke; es ist daher der Modus fĂŒr StilĂŒbertragungen, Full-Face-Glow-ups und Skizze-zu-fertiges-Bild-DurchlĂ€ufe.InpaintingbehĂ€lt alles auĂerhalb der Maske bei und generiert nur den bemalten Bereich neu, was die bessere Wahl ist, wenn Sie ein Gesicht ersetzen, ein Hintergrundobjekt Ă€ndern oder einen bestimmten Bereich korrigieren mĂŒssen.
Wenn sich die Stimmung des Bildes gröĂtenteils Ă€ndern soll, verwenden Sieimg2imgmit einer mittleren StĂ€rke. Wenn sich nur ein Teil Ă€ndern soll, malen Sie eine Maske undinpaintenSie. Diese einzige Entscheidung verhindert viel Frustration, da das Modell Teile des Bildausschnitts, die Sie erhalten wollten, nicht âhilfreichâ umschreiben kann.
Wenn Leute nicht weiterkommen, liegt das meistens daran, dass sie von img2img einen chirurgischen Eingriff verlangen oder von Inpainting ein komplett neues Design. Ein professionelles PortrÀtfoto mit einer neuen Frisur funktioniert so oder so, aber ein Gesichtstausch, ein Objektaustausch oder eine Hintergrundkorrektur verhalten sich fast immer besser mit einer Maske. Der Grund ist einfach. Inpainting gibt dem Modell eine Begrenzung, und Begrenzungen helfen dem Denoiser, sich zu fokussieren.
Halten Sie die Bearbeitung so lokal wie möglich. Je kleiner der Bereich, desto einfacher ist es, IdentitÀt, Layout und Textur zu erhalten.
Derselbe Workflow wird in Tools wie demBearbeitungsmodus von starryaibereitgestellt, wo Upload und Bearbeitung hinter einer einfachen BenutzeroberflĂ€che statt einer lokalen Installation liegen. FĂŒr eine Schritt-fĂŒr-Schritt-Anleitung zur Plattform ist derenLeitfaden zur Verwendung von Stable Diffusionein vernĂŒnftiger Referenzpunkt, wenn Sie BenutzeroberflĂ€chen vergleichen, anstatt Ihre eigene Umgebung einzurichten.

Schlechte Vorbereitung fĂŒhrt schneller zu schlechten Bearbeitungen als schlechte Prompts. Wenn das Quellbild rauschhaft, schlecht zugeschnitten oder aus drei Richtungen gleichzeitig beleuchtet ist, muss das Modell zu viel raten und das Ergebnis beginnt zu driften. Ich habe viel bessere Ergebnisse erzielt, wenn ich eng auf das Motiv zuschneide, die Beleuchtung lesbar halte und es vermeide, dem Editor einen unĂŒbersichtlichen Bildausschnitt zu fĂŒttern, es sei denn, das Chaos ist Teil der eigentlichen Ănderung.
Das Quellbild sollte klar genug sein, dass das Modell das Motiv lesen kann, ohne gegen KomprimierungsschÀden anzukÀmpfen. Ein leicht geschÀrftes Bild verhÀlt sich in der Regel besser als ein weiches, verschmiertes, und es hilft, offensichtliche Artefakte vor der Bearbeitung zu entfernen. Wenn Sie ein Gesicht oder ein Produkt bearbeiten, zoomen Sie heran, damit das Modell seine Aufmerksamkeit auf das Ding richtet, das Sie Àndern möchten.
FĂŒr Masken gilt die Regel gleichermaĂen direkt.Pinselmaskenlassen sich besser kontrollieren als eine automatische Auswahl, wenn es auf den Bereich ankommt, undweiche Kantenvermischen sich in der Regel besser als harte Schnittlinien. Ein wenig Maskendehnung oder -unschĂ€rfe verhindert, dass der Ăbergang wie ein aufgeklebtes Pflaster aussieht, was der Punkt ist, an dem sich die meisten âKI-aussehendenâ Bearbeitungen verraten.
Praxisregel:beginnen Sie mit der kleinsten Maske, die die Ănderung noch vollstĂ€ndig abdeckt, und lassen Sie dann den Rand auslaufen, damit das Modell Raum zum Vermischen hat.
FĂŒr viele Gesichtstausche ist eine RauschunterdrĂŒckungsstĂ€rke von etwa0.4 bis 0.6ein vernĂŒnftiger Ausgangspunkt, wĂ€hrend subtilere Umgestaltungen normalerweise weniger erfordern. Höhere StĂ€rken sind besser fĂŒr die vollstĂ€ndige Neuerstellung von Bereichen reserviert, da stĂ€rkeres Rauschen dem Modell die Erlaubnis gibt, mehr Struktur umzuschreiben. Wenn Sie das Motiv vor der Bearbeitung isolieren mĂŒssen,HintergrundentfernerSeite ist relevant, weil eine saubere Trennung oft die halbe Miete ist.
Der gröĂte Prompt-Fehler bei der Bildbearbeitung ist die Vermischung von dem, was zum gesamten Bild gehört, und dem, was nur in den Bearbeitungsbereich gehört.Bildbasierte Promptssollten Stimmung, Beleuchtung, KameragefĂŒhl oder den Gesamtstil beschreiben.Masken-lokalisierte Promptssollten beschreiben, was im bemalten Bereich erscheinen soll. Wenn Sie das Modell bitten, beides gleichzeitig zu lösen, wird das Ergebnis meist vage, ĂŒberladen oder seltsam wörtlich.
| Aufgabe | Positives Prompt-Skelett | Negativer Prompt |
|---|---|---|
| Selfie-Glow-up | reine Haut, weiche Studiobeleuchtung, natĂŒrliche Gesichtsdetails, dezente Haarveredelung, Social-Media-PortrĂ€t | verschwommen, plastische Haut, zusĂ€tzliche Finger, Wasserzeichen, Text |
| Cinematisches Buchcover-Mockup | dramatische Beleuchtung, genretypische AtmosphÀre, zentriertes Motiv, coverreife Komposition, hoher Kontrast | zufÀlliger Text, Wasserzeichen, unruhiger Hintergrund, verzerrtes Gesicht, geringe Details |
| Merch-Grafik | saubere vektorĂ€hnliche Grafik, zentrierter Druckbereich, krĂ€ftiger Kontrast, isoliertes Motiv, Produkt-Mockup-GefĂŒhl | Falten ĂŒber dem Design, Hintergrundunordnung, zusĂ€tzliche Objekte, Wasserzeichen, Text |
| Fantasie-Avatar-PortrĂ€t | detailliertes CharakterportrĂ€t, ausgewogene Beleuchtung, starke IdentitĂ€t, KostĂŒmdetail, Fantasiestimmung | gebrochene Anatomie, zusĂ€tzliche Finger, verschwommenes Gesicht, Wasserzeichen, Text |
FĂŒr einTikTok-Ă€hnliches Selfie-Glow-uphalten Sie den Prompt prĂ€gnant: ânatĂŒrliches Gesichtsdetail, weiches Leuchten, saubere Hautstruktur, vorteilhafte Beleuchtung, realistische Haarveredelungâ. Der negative Prompt sollte die IdentitĂ€t schĂŒtzen und eine ĂberglĂ€ttung vermeiden: âverschwommen, plastische Haut, zusĂ€tzliche Finger, Wasserzeichen, Textâ. Diese Kombination drĂ€ngt den Editor eher zu einer Verbesserung als zu einer völlig anderen Person.
FĂŒr einBuchcover, sollte der Prompt Stimmung und Layout steuern, nicht nur Stilwörter. Verwenden Sie eine Sprache wie âcinematische Beleuchtung, stimmungsvolle AtmosphĂ€re, zentrales Motiv, dramatische Schatten, coverreife Kompositionâ und blockieren Sie dann versehentlichen Text mit einem negativen Prompt, der ausdrĂŒcklichzufĂ€lliger Textsagt. FĂŒrMerchhalten Sie den positiven Prompt an einer sauberen DruckoberflĂ€che verankert und vergessen Sie nicht, den Hintergrundunordnung auszuschlieĂen, da Design-Assets schlechter aussehen, wenn der Editor Details um die Grafik herum erfindet. SchĂŒtzen Sie bei einemAvatarzuerst das Gesicht und die IdentitĂ€t und fĂŒgen Sie dann an zweiter Stelle die KostĂŒmsprache hinzu.
Negative Prompts leisten bei der Bearbeitung mehr Arbeit als bei der reinen Generierung, da sie die Teile verteidigen, die Sie nicht neu generieren. Das Modell braucht keine endlosen Anweisungen. Es braucht einen Zaun.
Die Einstellung, die das Ergebnis am meisten verĂ€ndert, ist dieEntrauschungsstĂ€rke. Niedrigere Werte halten Struktur und Farbe nĂ€her an der Quelle, wĂ€hrend höhere Werte dem Modell mehr Spielraum geben, das Bild neu aufzubauen. Bei der Bearbeitung ist die StĂ€rke daher der erste Regler, den man anpassen sollte, wenn sich das Ergebnis zu wörtlich oder zu weit entfernt anfĂŒhlt.
Geschwindigkeit ist wichtig, weil Bearbeitung sich nur dann iterativ anfĂŒhlt, wenn die Bearbeitungszeit kurz bleibt. Die gemeldete Inferenz auf einerA100 GPUbetrĂ€gt etwa2 SekundenfĂŒr ein512Ă512Bild bei50 Schritten, und eine Verbraucher-RTX 3090kann Ă€hnliche Arbeiten in etwa1,5 bis 5 SekundenbewĂ€ltigen, je nach Version und Einstellungen. Eine von Fachleuten begutachtete Zusammenfassung merkt ebenfalls an, dass Stable Diffusion auf den meisten Consumer-Komponenten laufen kann, mit einem Minimum an4 GB VRAMfĂŒr die512Ă512Nutzung (technische PMC-Zusammenfassung).
Wenn die Bearbeitung ausgewaschen aussieht, erhöhen Sie die Prompt-SpezifitÀt, bevor Sie die Schritte erhöhen. Wenn die Bearbeitung zu wörtlich ist, verringern Sie zuerst das Denoising. Wenn es abweicht, ist normalerweise die Maske oder die Komposition das Problem, nicht der Sampler.
Eine Selfie-Bearbeitung erfordert normalerweiseInpaintingĂŒber Gesicht und Haare, keinen Full-Frame-img2img-Durchlauf. Halten Sie die Maske eng um Haut, Pony und Problembereiche, und verwenden Sie dann mĂ€Ăiges Denoising, damit Ausdruck und IdentitĂ€t erhalten bleiben. Ein Prompt wie ânatĂŒrliche Gesichtsdetails, weiches Licht, sauberer Haaransatz, realistisches PortrĂ€tâ leistet bessere Dienste als ein Haufen Stil-Adjektive.
Ein Buchumschlag funktioniert besser alsimg2img, wenn die gesamte Komposition Stimmung und Genrezusammenhalt benötigt. Beginnen Sie mit dem groben Mockup, halten Sie die StĂ€rke moderat und fĂŒttern Sie das Modell mit einem Prompt zu AtmosphĂ€re, Motivplatzierung und Finish, wĂ€hrend der negative Prompt zufĂ€lligen Text und Unordnung blockiert. Das Ziel ist es, das Cover als Cover lesbar zu halten, nicht es nur hĂŒbscher zu machen.
Merch ist normalerweise einmasken-zuerstjob. Schneiden Sie den druckbaren Bereich aus, sperren Sie den Hintergrund und fĂŒllen Sie die Grafik- oder Platzierungsdetails per Inpainting auf, damit das KleidungsstĂŒck glaubwĂŒrdig bleibt. Wenn die Hemdtextur beginnt, sich um das Design herum zu verzerren, ist die Maske zu breit oder die StĂ€rke zu hoch.
Ein Avatar erfordert oft einen Ansatz in zwei Schritten. Verwenden Sie zuerst img2img, um IdentitĂ€t und Gesamtpose zu erhalten, und machen Sie dann Inpainting fĂŒr KostĂŒm- oder AusdrucksĂ€nderungen in kleineren Bereichen. Diese Aufteilung hĂ€lt das Gesicht kohĂ€rent und lĂ€sst Sie den Charakter dennoch in eine neue Rolle versetzen.

Die meisten misslungenen Bearbeitungen rĂŒhren von nicht zusammenpassender StĂ€rke, schwacher Maskierung oder einem Prompt her, der zu viel auf einmal verlangt. Wenn ein Gesicht sich verzerrt, HĂ€nde auseinanderbrechen oder das Modell den maskierten Bereich ignoriert, ist die Lösung meist kleiner, als die Leute denken. Ich erziele bessere Ergebnisse, indem ich die StĂ€rke in kleinen Schritten nach unten korrigiere, als den gesamten Prompt von Grund auf neu zu schreiben.
Die Kamerawinkelsteuerung ist ein eigener Schmerzpunkt. Text-Prompts allein versagen oft, wenn Sie einen bestimmten Winkel benötigen, und deshalb nutzen Ersteller am Ende ControlNet, Tiefenkarten, Posenkarten oder ein Referenzbild, um die Komposition zu erzwingen. Wenn Sie versuchen, dasselbe Subjekt ĂŒber mehrere Ansichten hinweg konsistent zu halten, besteht das Problem nicht nur darin, einen Frame zu bearbeiten, sondern die Struktur beizubehalten, wĂ€hrend sich die Kamera bewegt.
Die sicherste Gewohnheit ist es, die Originaldatei zu behalten und in kleinen StĂ€rkeschritten zu arbeiten. FĂŒhren Sie die Bearbeitung mit einem etwas niedrigeren Rauschwert erneut aus, bevor Sie den Prompt komplett ĂŒberarbeiten, da groĂe SprĂŒnge dazu neigen, die Teile zu löschen, die Ihnen bereits gefallen haben. Auch eine klare Einwilligung ist wichtig, wenn Sie das Gesicht einer anderen Person bearbeiten, und Plattformregeln spielen eine Rolle, sobald das Bild Ihren Editor verlĂ€sst. Tools wiestarryaiund Ă€hnliche Apps filtern unsichere Prompts bereits auf Systemebene, aber die finale Entscheidung liegt nach wie vor bei Ihnen.
Modus zuerst, Maske als Zweites, Prompt als Drittes, Einstellungen zuletzt. Diese Reihenfolge spart Zeit, da sie die Hauptursache der meisten schlechten Bearbeitungen angeht, anstatt jeden Fehler wie ein Prompt-Problem zu behandeln. WĂ€hlen Sie eines der vier Szenarien oben aus, fĂŒhren Sie es einmal aus und nutzen Sie das Ergebnis, um Ihr eigenes Auge zu schulen, anstatt eine weitere Stunde mit RĂ€tselraten zu verbringen.
Wenn Sie einen einfachen Ort suchen, um diese Workflows zu testen, bietet Ihnenstarryaieinen Upload-und-Bearbeiten-Pfad, der zu dieser Art von Iteration ohne komplizierte Einrichtung passt. Probieren Sie ein Selfie, ein Cover-Mockup oder einen Avatar-Durchlauf aus und vergleichen Sie dann, wie sich Inpainting und img2img auf Ihren eigenen Bildern verhalten. Besuchen Siestarryaiund beginnen Sie mit dem Bearbeitungsmodus, der zu der Aufgabe passt, die Sie abschlieĂen möchten.