
🌐 También en: English · Deutsch · Français
En mi último artículo estaba, digamos, extremadamente entusiasmado. Mi viejo PC torre de repente generaba imágenes a partir de prompts en alemán, funcionaba como un servicio systemd bien ordenado y hasta tenía su propia interfaz web al estilo ChatGPT. Prácticamente flotaba. Muchos prompts después: la euforia se ha enfriado un poco. No ha desaparecido, pero me he topado con un muro sobre el que merece la pena escribir, porque me enseñó algo importante sobre cómo funcionan realmente estos modelos de imagen por dentro.⚙️ Qué hemos cambiado desde la última vez
Hubo dos mejoras:- FLUX.1-schnell → FLUX.1-dev. «Schnell» es la versión «destilada» de FLUX en 4 pasos, optimizada para la velocidad: rápida (~1 min/imagen), pero claramente imprecisa en los detalles y en la fidelidad al prompt. FLUX.1-dev usa ~20 pasos y un nodo extra de «guidance», y cambia velocidad (~2-3 min/imagen) por resultados más nítidos, más fotorrealistas y un mejor seguimiento de las instrucciones.
- Añadido Ollama + qwen2.5 (7B) como preprocesador de prompts. Es un LLM aparte, solo de texto, que ahora se sitúa antes de FLUX en el pipeline. Mis prompts cortos en alemán se traducen automáticamente y se amplían a descripciones detalladas en inglés (ángulo de cámara, iluminación, estilo) antes de que FLUX llegue a verlos, porque la comprensión de texto de FLUX se entrenó sobre todo con descripciones largas y detalladas en inglés, no con «Auto am Strand, Vorderansicht».
✅ La buena noticia: lo sencillo ahora sale genial de verdad
Para peticiones directas del tipo «genérame una imagen de X», este combo es realmente bueno. Mi prueba de cabecera, «un Honda S2000 dorado en la playa, vista frontal», volvió como una auténtica vista frontal de un S2000 dorado en una playa, bien iluminado, como sacado de un anuncio de coches. Incluso respetó la indicación del punto de vista, algo que los intentos anteriores simplemente… no hacían. Entonces: ¿texto a imagen, en alemán, para escenas relativamente sencillas? 👍 Funciona bien.❌ La mala noticia: hacer cambios concretos y dirigidos a una imagen no funciona bien
Pero ahí es justo donde está mi caso de uso real: no quiero solo imágenes nuevas al azar, quiero coger una imagen existente y aplicarle cambios específicos y dirigidos. «Haz que el dragón escupa fuego azul.» «Cambia este coche a rojo.» «Ponle gafas de sol a esta persona.» Ese tipo de cosas. Y aquí es donde todo sigue descarrilando. El pipeline img2img que montamos funciona con un único control deslizante de «cuánto debe cambiar esto» (la intensidad de denoise), y el compromiso es brutal:- Denoise bajo → el cambio pedido apenas se nota
- Denoise alto → obtengo una imagen completamente distinta que encaja vagamente con el nuevo prompt, pero la composición original, la pose, los colores (básicamente todo lo que quería conservar) han desaparecido





