
đ Auch auf: English ¡ Français ¡ EspaĂąol
In meinem letzten Beitrag war ich, sagen wir mal, extrem gehypt. Mein alter Tower-PC erzeugte plĂśtzlich Bilder aus deutschen Prompts, lief als ordentlicher systemd-Dienst und hatte sogar eine eigene kleine Web-Oberfläche im ChatGPT-Stil. Ich schwebte praktisch. Viele Prompts später: Die Euphorie hat sich etwas abgekĂźhlt. Nicht verflogen â aber ich bin gegen eine Wand gelaufen, Ăźber die es sich zu schreiben lohnt, denn sie hat mir etwas Wichtiges darĂźber beigebracht, wie diese Bildmodelle unter der Haube eigentlich funktionieren.âď¸ Was sich seit dem letzten Mal geändert hat
Zwei Upgrades gab es:- FLUX.1-schnell â FLUX.1-dev. âSchnellâ ist die auf Tempo getrimmte, âdestillierteâ 4-Schritt-Variante von FLUX â flott (~1 Min./Bild), aber spĂźrbar ungenau bei Details und Prompt-Treue. FLUX.1-dev nutzt ~20 Schritte und einen zusätzlichen âGuidanceâ-Node und tauscht Geschwindigkeit (~2â3 Min./Bild) gegen schärfere, fotorealistischere Ergebnisse und bessere Befolgung der Anweisungen.
- Ollama + qwen2.5 (7B) als Prompt-Vorverarbeitung dazu. Das ist ein separates, reines Text-LLM, das jetzt in der Pipeline vor FLUX sitzt. Meine kurzen deutschen Prompts werden automatisch Ăźbersetzt und zu ausfĂźhrlichen englischen Beschreibungen erweitert (Kamerawinkel, Licht, Stil), bevor FLUX sie Ăźberhaupt zu sehen bekommt â denn FLUXâ Textverständnis wurde Ăźberwiegend auf langen, detaillierten englischen Bildbeschreibungen trainiert, nicht auf âAuto am Strand, Vorderansichtâ.
â Die gute Nachricht: Einfache Sachen sind jetzt richtig gut
FĂźr simple âMach mir ein Bild von Xâ-Anfragen ist diese Kombi wirklich gut. Mein Standardtest â âein goldener Honda S2000 am Strand, Vorderansichtâ â kam als echte Frontansicht eines goldenen S2000 an einem Strand zurĂźck, sauber ausgeleuchtet, wie aus einer Autowerbung. Sogar die Vorgabe zur Perspektive wurde beachtet, was frĂźhere Versuche einfach ⌠nicht taten. Also: Text-zu-Bild, auf Deutsch, fĂźr relativ einfache Szenen? đ Funktioniert gut.â Die schlechte Nachricht: Gezielte Ănderungen an einem Bild klappen nicht gut
Genau da liegt aber mein eigentlicher Anwendungsfall: Ich will nicht nur zufällige neue Bilder â ich will ein bestehendes Bild nehmen und konkrete, gezielte Ănderungen vornehmen. âLass den Drachen blaues Feuer speien.â âMach dieses Auto rot.â âSetz dieser Person eine Sonnenbrille auf.â So was in der Art. Und hier fliegen mir immer noch die Räder ab. Die img2img-Pipeline, die wir gebaut haben, arbeitet mit einem einzigen âWie stark soll sich das ändernâ-Regler (Denoise-Stärke), und der Kompromiss ist brutal:- Niedriges Denoise â die gewĂźnschte Ănderung ist kaum zu sehen
- Hohes Denoise â ich bekomme ein komplett anderes Bild, das grob zum neuen Prompt passt, aber die ursprĂźngliche Komposition, Pose, Farben â im Grunde alles, was ich behalten wollte â sind weg





