Como Midjourney ha sido ampliamente probado por el público, se han identificado algunos problemas con las imágenes generadas por IA, desde una sensación de asombro hasta el hecho de que las imágenes generadas por Midjourney suelen tener un estilo similar, que podrías llamar “cremoso” y demasiado homogéneo, y que Midjourney no ofrece privacidad: si eres usuario gratuito, tus imágenes estarán expuestas al resto de la comunidad, y si eres usuario de pago, no puedes descartar la posibilidad de que tus imágenes sean “robadas” para otros fines.
Stable Diffusion proviene de un ecosistema de código abierto y, con la combinación de capacidades de plugins y la creatividad de los usuarios, se pueden explorar más escenarios de aplicación. No te conformarás con simplemente generar una imagen a partir de una descripción como en Midjourney, sino que lo tratarás como un diseñador de estilos, y es entonces cuando comienzan las cosas divertidas y valiosas.
En la comunidad, explorarás muchos modelos altamente estilizados, como ChilloutMix para estilo manga japonés, MoXin para estilo tinta china, e incluso modelos que imitan el rostro de una estrella de cine. Puedes cargar estos modelos entrenados para generar imágenes con un mayor grado de personalización. Cuando realmente avance a la etapa de disponibilidad comercial, creo que el enfoque del mercado se desplazará de Midjourney a Stable Diffusion.
¿Qué necesitas si quieres alojar un entorno Stable Diffusion por ti mismo?
Preparación de hardware
1. Una computadora con WindowsPreferiblemente una computadora con Windows, las Mac pueden presentar más dificultades con los controladores de la tarjeta gráfica. 2. Una GPU NV con más de 6GBSi quieres hacer entrenamiento, al menos 12GB de memoria de video.
3. Memoria superior a 16GB8GB de memoria está bien, pero es difícil cargar los excelentes modelos de la comunidad.
Proceso de instalación y precauciones
1. Instala el entorno Python. Durante la instalación, asegúrate de que la opción Añadir Python al PATH esté marcada.
2. Instala el entorno git.
3. En CMD, ejecuta el siguiente comando para descargar stable-diffusion: git clone https://github.com/AUTOMATIC1111/stable-diffusion-webui.git.
4. Inicia la interfaz web de stable-diffusion Usa el explorador de archivos para encontrar el archivo webui-user.bat descargado y ejecútalo sin privilegios de administrador.
5. Según el mensaje en el paso anterior, abre la dirección IP y se mostrará la interfaz de usuario – Si hay algún error en los pasos anteriores, puedes pedir ayuda a GPT para resolverlo.
Diseña un pequeño objetivo – unas pocas imágenes para entrenar un modelo pequeño
Algunos conceptos importantes que debes entender

modelo principal
– El modelo principal que afecta el estilo de salida, puedes usar el modelo original v1.5 en la ilustración.
– Puedes elegir un modelo que te guste en civitai y colocarlo en la ubicación especificada …/stable-diffusion-webui/models/Stable-diffusion
palabra clave (prompt) – Ingresa la descripción textual de la imagen que quieres generar, por ejemplo, Un padre chino envejecido sosteniendo un cuenco de arroz, Características especiales
Pasos de muestreo – Generalmente, a mayor número de pasos, más refinada la imagen, pero mayor tiempo de espera. Normalmente lo configuro entre 20-40.
Longitud y ancho – 512×512 es un tamaño razonable, si tienes requisitos especiales para la proporción de la imagen, también puedes modificarlo.
Generar – Haz clic en el botón generar para ejecutar la generación, si no estás satisfecho, intenta varias veces.
Semillas (seeds) – Si consideras que la composición generada es buena, puedes seguir usando esta semilla en la siguiente generación guardando la imagen abajo.

Opciones avanzadas
Extra – Marca esta casilla para abrir opciones extendidas – La intensidad de diferencia puede aumentar el detalle de la imagen, si crees que la imagen es demasiado simple puedes aumentar este valor.

Adjuntar estilo al modelo – Haz clic en el botón rojo “mostrar redes extra” debajo del botón Generar para expandir el panel adicional – Los mini modelos pueden descargarse desde civitai, o puedes entrenarlos tú mismo.

– La red hiper es más universal, y LoRA es más adecuada para generación de retratos.

– Los mini modelos se colocan en la carpeta correspondiente dentro de models y pueden verse y seleccionarse.

– Después de seleccionar el “estilo”, los parámetros del estilo se añadirán al prompt, y el parámetro que sigue representa la concentración.

Acciones para lograr el mini objetivo (entrenamiento)
1. Prepara el conjunto de entrenamiento

– Unas 20 imágenes son suficientes para entrenar un pequeño modelo de estilo agradable – como inicio, 5 imágenes con un estilo específico están bien – el tamaño de las imágenes en el conjunto de entrenamiento debe ser idéntico. 2. Crea la red hiper – En el entrenamiento, ingresa un nombre para crear una red hiper.

3. Preprocesa las imágenes – En este paso, la IA generará primero una descripción textual basada en la imagen de entrenamiento. – En la imagen preprocesada, llena la dirección de la carpeta de las imágenes de entrenamiento y la dirección de la carpeta de salida de las imágenes preprocesadas. – Modifica el tamaño de aspecto de la imagen de entrenamiento – Si el tamaño no es igual, puedes usar Birme para modificar el tamaño de las imágenes en lote primero. – Marca la opción BLIP y haz clic en el botón Preprocesar para realizar el preprocesamiento.

– espera a que se complete cada imagen de entrenamiento junto a un archivo txt, el texto es la descripción de la imagen correspondiente. – Habrá inexactitudes en las descripciones, puedes modificarlas manualmente – La precisión de las descripciones determina en cierta medida la efectividad del entrenamiento.


4. Entrenamiento – En el entrenamiento, selecciona la red hiper que acabas de crear. 2. – ingresa una tasa de aprendizaje de 0.00005 – En el entrenamiento inicial 4 ceros son apropiados, en entrenamientos posteriores reduce gradualmente el número de ceros – ingresa el directorio con las descripciones de texto e imágenes – modifica el tamaño de la imagen – elige 2000 pasos iterativos – Generalmente, para 2000 pasos de entrenamiento, toma 1 hora en una tarjeta gráfica serie 10 y media hora en una serie 30 – Haz clic en el botón Entrenar red hiper para comenzar el entrenamiento.

5. Presentación de resultados – Después de iniciar el entrenamiento, puedes ver el proceso en la ventana de vista previa.

– Después del entrenamiento, puedes ver el proceso en … /stable-diffusion-webui/textual_inversion/date/… Puedes encontrar los resultados del entrenamiento en la carpeta hyper networks – en la carpeta images están los resultados del proceso de entrenamiento – Puedes revisar las imágenes y decidir qué resultado de entrenamiento es el adecuado.

– En la carpeta hyper networks, los archivos con sufijo .pt son los modelos de estilo entrenados – Por ejemplo, si consideras que el resultado del paso 1400 es adecuado, puedes mover el archivo pt del paso 1400 a models/hyper networks como estilo.

– Usar los resultados del entrenamiento para generar imágenes – En “txt a img” y “img a img”, selecciona el estilo que acabas de entrenar y genera. – Si el estilo no es lo suficientemente fuerte, puedes aumentar el factor.

– ¡Diviértete!
Recientemente se lanzaron los últimos desarrollos y mi comprensión
Recientemente Stable Diffusion ha introducido un nuevo modelo llamado DeepFloyd IF, que mejora enormemente una serie de problemas criticados en el dibujo por IA. Por ejemplo, imágenes generadas por IA con relaciones espaciales problemáticas, personajes con múltiples dedos en sus extremidades, y la incapacidad de manejar relaciones lógicas complejas. Francamente, creo que para la IA de imágenes, el futuro está del lado del código abierto y el despliegue privado.
La sociedad humana es diversa y diferente a nivel visual, y las herramientas con ciertos estilos y tendencias no pueden cubrir un área amplia. La diferencia entre humanos y humanos en cuanto a estética es la diferencia en los conjuntos de entrenamiento, no hay diferencia entre humanos y IA, y el despliegue privado del entrenamiento para asegurar la independencia estética, la “independencia” puede restaurar un mayor grado de “diversidad”.
Centro de Campañas Zima
Más para leer

Cómo un NAS pequeño se convirtió en un archivo familiar con ZimaOS
Una verdadera historia de un NAS doméstico sobre la preservación de registros médicos, fotos familiares, música y recuerdos cotidianos, y las lecciones prácticas para...

Día de la Libertad del Software 2026: Las mejores aplicaciones de código abierto para alojar en casa
Explora herramientas útiles de autoalojamiento para almacenamiento, respaldo de fotos, transmisión de medios, documentos y automatización del hogar en un servidor confiable en casa.

Día Mundial de la Fotografía: Cómo Respaldar y Organizar una Vida de Fotos
Reúne fotos dispersas, crea un archivo sencillo, automatiza copias de seguridad, verifica la recuperación y aprende cuándo vale la pena el almacenamiento centralizado.
