
🌐 Auch auf: English · Français · Español
Wie in meinem letzten Beitrag angekündigt, wollte ich mich endlich in die Welt der lokalen KI-Tools einarbeiten. Du weißt schon, das Zeug, mit dem die coolen Kids auf Reddit ständig angeben: eigene Bildgenerierungsmodelle auf eigener Hardware, ohne dass dich irgendein Cloud-Anbieter heimlich drosselt, weil du einmal zu oft nach „einer Katze mit Zauberhut“ gefragt hast. Also habe ich meinen in die Jahre gekommenen Tower-PC aus dem Halbruhestand gezerrt, ein frisches Debian draufgeklatscht und – bewaffnet mit einer Schritt-für-Schritt-Anleitung, die ChatGPT mir freundlicherweise geschrieben hatte – angefangen, ComfyUI und FLUX.1-schnell zu installieren. Meine Hauptmotivation? Ich erzeuge jede Menge Bilder für diesen Blog, und ChatGPT/DALL-E & Co. hauen mir nach etwa drei Prompts liebend gern ein „Du hast dein Limit erreicht“ oder „Das verstößt gegen unsere Inhaltsrichtlinien“ um die Ohren. Toll. Echt toll. Zeit, das selbst zu hosten. 💪😴 Dann … kam mir was dazwischen
Der Klassiker: Vor ein paar Tagen hatte ich die Grundlagen installiert, bin dann an einer Hürde hängen geblieben, habe die Lust verloren und das Setup mittendrin liegen lassen – venv halb aktiviert, Browser-Tab offen, die Terminal-History voller halbfertiger Befehle. Digitale Archäologie, die nur darauf wartet, ausgegraben zu werden. Heute dachte ich mir: „Geben wir das Chaos einfach Claude und schauen, was passiert.“ Also habe ich ihm SSH-Zugriff auf die Kiste gegeben und im Grunde gesagt: „Mach fertig, was ich angefangen habe.“ Was dann kam, war ehrlich gesagt einer der surrealeren Nachmittage, die ich je mit einer Software verbracht habe.🕵️ Schritt 1: Claude spielt Detektiv
Statt alles plattzumachen und neu anzufangen (seien wir ehrlich: mein üblicher Ansatz), hat es zuerst tatsächlich meine Shell-History gelesen. Wie ein echter Ermittler. Herausgefunden hat es:- ComfyUI war schon geklont und in einem venv unter
~/ai/ComfyUIeingerichtet - Die FLUX.1-schnell-Gewichte (ein fettes 23-GB-UNet plus CLIP/T5-Text-Encoder und VAE) waren bereits heruntergeladen
- Die GPU war eine RTX 3050 mit 8 GB VRAM – Debian 13, 32 GB RAM, 16 Kerne
⚙️ Schritt 2: „Mach einen richtigen Dienst draus“ – jawohl
Ich wollte ComfyUI als ordentlichen Hintergrunddienst haben (weil ich nicht wie ein Barbar rund um die Uhr eine SSH-Sitzung offen lasse). Claude hat einesystemd-Unit geschrieben, sie aktiviert, und nach etwa zwei Minuten lief das Ganze dauerhaft. Reboot-fest. Automatischer Neustart bei Absturz. Das volle Programm.🇩🇪 Schritt 3: „Versteht es eigentlich auch deutsche Prompts?“
Das war der Moment, in dem mir tatsächlich ein bisschen die Kinnlade runterfiel. Ich wollte wissen, ob ich Prompts einfach auf Deutsch eintippen kann (weil das nun mal meine Muttersprache ist und ich faul bin). Also hat Claude spontan einen kleinen FLUX-Text-to-Image-Workflow für die API gebaut und ihn gefüttert mit:„Ein gemütliches Café in Paris bei Sonnenuntergang, digitale Kunstmalerei, warmes Licht, Menschen sitzen draußen“… rund 60 Sekunden gewartet, das fertige PNG per SCP heruntergeladen und mir gezeigt. Eine wirklich hübsche kleine Pariser Café-Szene im Sonnenuntergang. Auf Deutsch. Im ersten Versuch. Ich hatte nicht erwartet, dass das einfach so funktioniert. ☕
🧩 Schritt 4: „Diese Oberfläche hat 4000 Knöpfe und ich will nur ein Textfeld“
Dann habe ich die eigentliche ComfyUI-Weboberfläche geöffnet und … tja. Überall Node-Graphen. Schieberegler, Dropdowns, Kabel zwischen Kästchen wie bei einem Synthesizer-Steckfeld, entworfen von jemandem, der Nodes wirklich, wirklich liebt. Ich habe im Grunde gesagt: „Ich will einfach so was wie ChatGPT – ein Feld, Text rein, Bild raus.“ Also hat Claude mir eine eigene Mini-Web-App von Grund auf gebaut:- Eine Flask-App mit genau einem Textfeld und einem Button
- Im Hintergrund baut sie das komplette FLUX-Workflow-JSON, schickt es an die API von ComfyUI, fragt so lange nach, bis es fertig ist, und liefert das fertige Bild aus
- Ebenfalls in einen eigenen
systemd-Dienst verpackt, auf einem eigenen Port
🖼️ Schritt 5: „Okay, aber kann ich ein Bild hochladen und es verändern lassen?“
Ich war jetzt richtig in Fahrt, also habe ich mein Glück versucht: „Kann ich ein vorhandenes Bild als Vorlage hochladen und die KI es abwandeln lassen?“ (img2img, für die Nerds im Publikum.) Claude hat:- Pillow in einem separaten venv für die Bildvorverarbeitung ergänzt (Skalierung auf Vielfache von 16, weil VAEs bei den Abmessungen offenbar wählerisch sind)
- Den Workflow um die Nodes
LoadImage+VAEEncodeerweitert - Einen Schieberegler für die „Veränderungsstärke“ (Denoise) in die Oberfläche eingebaut
- Und es dann tatsächlich selbst getestet: das Drachenbild wieder hochgeladen und „der Drache speit jetzt blaues Feuer, es ist Nacht mit Sternenhimmel“ verlangt
📊 Schritt 6: Jetzt stelle ich die dummen Fragen
Natürlich musste ich selbst an der Kiste herumstochern und habetop laufen lassen, während eine Generierung lief:MiB Spch: 32013,4 total, 632,3 free, 22986,9 used, 8827,1 buff/cache
MiB Swap: 32680,0 total, 27500,7 free, 5179,2 used. 9026,5 avail Spch
PID USER PR NI VIRT RES SHR S %CPU %MEM ZEIT+ BEFEHL
1221 me 20 0 56,5g 21,2g 112128 S 55,1 67,7 3:34.24 python21 GB RAM für einen einzigen Python-Prozess?! 😱 Ich fragte: „Ist das normal? Macht die GPU überhaupt irgendwas? Müssten meine Lüfter nicht gerade schreien?“ Claude hat in aller Ruhe erklärt: Das FLUX-Modell ist ca. 23 GB groß, meine GPU hat nur 8 GB VRAM, also macht ComfyUI „asynchrones Weight-Offloading“ – der Großteil des Modells bleibt im gepinnten System-RAM, und Teile davon werden bei Bedarf zur GPU gestreamt. Damit sind die RAM-Nutzung und die CPU-Last in einem Rutsch erklärt. Um die GPU-Frage dann richtig zu beantworten, hat es noch eine Generierung angestoßen und parallel in einer Schleife nvidia-smi abgefragt:Time GPU-Load VRAM Temp Fan
Start 34% 6.3 GB 42°C 0%
Sampling 100% 6.9 / 8 GB 53→62°C 0%
After 0-6% 3.2 GB 60→47°C 65%Ergebnis: Ja, die GPU wird beim Sampling mit 100 % voll ausgelastet, die 8 GB VRAM sind fast komplett belegt – aber der Lüfter dreht wegen der thermischen Trägheit erst nach dem Ende der Last hoch, und deshalb wird es während einer rund 60 Sekunden langen Generierung nicht laut. Rätsel gelöst, mit Belegen. ✅🤔 Und … wo stehe ich jetzt?
Ehrlich? Ich sitze hier, zu gleichen Teilen schockiert und fasziniert. Was als „Bitte installier dieses Ding fertig, bei dem ich aufgegeben habe“ begann, wurde zu einer live ablaufenden, iterativen Engineering-Session – neue Anforderungen tauchten mitten im Gespräch auf, wurden sofort aufgegriffen, getestet, feinjustiert und mir in verständlicher Sprache erklärt. Kein fünfmaliges Wiederholen des Kontexts. Kein „Das kann ich nicht“. Einfach … Fortschritt, in Echtzeit, auf meiner eigenen Hardware. Ich sag’s ganz direkt: Wer KI als „bloß eine schicke Autovervollständigung“, „gefährlichen Unsinn“ oder „Bullshit-Generator, der selbstbewusst klingt, während er falsch liegt“ abtut – ich glaube, ihr schaut euch einfach nicht an, wie dieses Zeug heute tatsächlich eingesetzt und orchestriert wird. Ich war früher selbst viel eher in diesem Lager. Ich habe meine Meinung geändert. Zuzusehen, wie es ein halbfertiges Setup untersucht, vernünftige Infrastrukturentscheidungen trifft, echten, funktionierenden Code schreibt, ihn ausrollt, gegen echte Modelle testet und dann die Qualität seines eigenen Outputs debuggt – das ist keine „Fantasie“. Das ist heute Abend in meinem LAN passiert. Und ja, genau das beunruhigt mich auch ein bisschen. Wenn eine Konversations-KI kompetent Dienste einrichten, kleine Anwendungen schreiben, systemd konfigurieren, das Speicherverhalten der GPU debuggen und das alles so erklären kann, dass ein Mensch es sofort versteht – was bedeutet das für IT-Jobs und Sysadmin-Arbeit in den nächsten 20 Jahren? Ich gerate nicht in Panik, aber ich tue auch nicht mehr so, als wäre die Frage albern. 🤷 Wie auch immer. Ich habe jetzt einen privaten, lokalen, unbegrenzten Bildgenerator auf einem PC, der früher unter meinem Schreibtisch Staub angesetzt hat. Rechne ab jetzt mit deutlich mehr (und schrägeren) KI-generierten Bildern in diesem Blog. Im nächsten Beitrag will ich weitergehen: das Setup um Prompt-Übersetzung, Codegenerierung und mehr erweitern – heute ging es nur um Bilderzeugung, aber das ist ganz klar erst der Anfang.






