Alors que Midjourney a été largement testé par le public, certains problèmes liés aux images générées par l’IA ont été identifiés, allant d’un sentiment d’émerveillement au fait que les images produites par Midjourney ont tendance à adopter un style similaire, que l’on pourrait qualifier de « crémeux » et trop homogène. De plus, si vous êtes un utilisateur gratuit, vos images seront exposées à toute la communauté, et même en tant qu’utilisateur payant, il n’est pas exclu que vos images soient « volées » à d’autres fins.
Stable Diffusion provient d’un écosystème open source, et grâce à la combinaison des capacités de plug-in et à la créativité des utilisateurs, davantage de scénarios d’application peuvent être explorés. Vous ne vous contenterez pas de générer une image à partir d’une description comme avec Midjourney, vous le considérerez comme un designer de style, et c’est là que les choses amusantes et précieuses commencent.
Dans la communauté, vous découvrirez de nombreux modèles très stylisés, tels que ChilloutMix pour le style manga japonais, MoXin pour le style encre chinoise, et même des modèles imitant le visage d’une star de cinéma. Vous pouvez charger ces modèles d’entraînement pour générer des images avec un degré de personnalisation plus élevé. Lorsque cela deviendra vraiment commercialement accessible, je pense que le marché se déplacera de Midjourney vers Stable Diffusion.
Que faut-il pour auto-héberger un environnement Stable Diffusion ?
Préparation matérielle
1. Un ordinateur Windows De préférence un ordinateur Windows, les Mac peuvent rencontrer plus de difficultés avec les pilotes de carte graphique. 2. Un GPU NV de plus de 6 Go Si vous souhaitez faire de l’entraînement, au moins 12 Go de mémoire vidéo.
3. Une mémoire dépassant 16 Go 8 Go de mémoire peuvent suffire, mais il est difficile de charger les excellents modèles de la communauté. Processus de construction et précautions.
1. Installer l’environnement Python Pendant l’installation, assurez-vous que Ajouter Python au PATH est coché.
2. Installer l’environnement git
3. Dans CMD, exécutez la commande suivante pour télécharger stable-diffusion git clone https://github.com/AUTOMATIC1111/stable-diffusion-webui.git.
4. Démarrer l’interface web stable-diffusion Utilisez l’explorateur de fichiers pour trouver le fichier webui-user.bat téléchargé et lancez-le sans droits administrateur.
5. Selon l’invite de l’étape précédente, ouvrez l’adresse IP, et l’interface utilisateur s’affichera – En cas d’erreur dans les étapes ci-dessus, vous pouvez demander à GPT de vous aider à résoudre le problème.
Concevoir un petit objectif – quelques images pour entraîner un petit modèle
Quelques concepts importants à comprendre

modèle principal
– Le modèle principal qui influence le style de sortie, vous pouvez utiliser le modèle original v1.5 illustré
– Vous pouvez choisir un téléchargement qui vous satisfait sur civitai et le placer à l’emplacement spécifié …/stable-diffusion-webui/models/Stable-diffusion
mot-clé (prompt) – Entrez la description textuelle de l’image que vous souhaitez générer, par exemple, Un père chinois usé tenant un bol de riz, Caractéristiques spéciales
Étapes d’échantillonnage – En général, plus le nombre d’étapes est élevé, plus le rendu est raffiné, mais plus le temps d’attente est long. En général, je le règle entre 20 et 40.
Longueur et largeur – 512×512 est une taille raisonnable, si vous avez des exigences particulières pour le ratio de l’image, vous pouvez aussi le modifier
Générer – Cliquez sur le bouton générer pour lancer la création, si vous n’êtes pas satisfait du premier résultat, essayez plusieurs fois
Graines (seeds) – Si vous trouvez la composition générée satisfaisante, vous pouvez continuer à utiliser cette graine lors de la génération suivante en sauvegardant l’image ci-dessous.

Options avancées
Extra – Cochez cette case pour ouvrir les options étendues – L’intensité de la différence peut augmenter le détail de l’image, si vous trouvez l’image trop uniforme, vous pouvez augmenter cette valeur

Associer un style au modèle – Cliquez sur le bouton rouge « show extra Networks » sous le bouton Générer pour déployer le panneau supplémentaire – Les miniatures peuvent être téléchargées depuis civitai, ou vous pouvez les entraîner vous-même.

– Le hyper network est plus universel, et LoRA est plus adapté à la génération de portraits

– Les mini-modèles sont placés dans le dossier correspondant sous models et peuvent être vus et sélectionnés

– Après avoir sélectionné le « style », les paramètres du style seront ajoutés au prompt, et les paramètres qui suivent représentent la concentration

Actions pour atteindre le mini-objectif (entraînement)
1. Préparer le jeu de données d’entraînement

– Environ 20 images suffisent pour entraîner un joli petit modèle de style – Pour commencer, 5 images avec un style spécifique conviennent – La taille des images du jeu d’entraînement doit être identique 2. Créer un Hypernetwork – Lors de l’entraînement, entrez un nom pour créer un hyper réseau

3. Prétraiter les images – À cette étape, l’IA génèrera d’abord une description textuelle basée sur l’image d’entraînement. – Dans l’image prétraitée, remplissez l’adresse du dossier des images d’entraînement et celle du dossier de sortie des images prétraitées. – Modifiez la taille des images d’entraînement – Si la taille n’est pas identique, vous pouvez utiliser Birme pour modifier la taille des images en lot. – Cochez l’option BLIP et cliquez sur le bouton Prétraiter pour lancer le prétraitement

–attendez la fin de chaque image d’entraînement, un fichier txt sera créé à côté, le texte est la description de l’image correspondante –il peut y avoir des imprécisions dans les descriptions, vous pouvez les modifier manuellement – La précision des descriptions détermine dans une certaine mesure l’efficacité de l’entraînement


4. Entraînement – Lors de l’entraînement, sélectionnez l’Hypernetwork que vous venez de créer. 2. – saisissez un taux d’apprentissage de 0,00005 – En entraînement initial, 4 zéros conviennent, puis réduisez progressivement le nombre de zéros – saisissez le répertoire contenant les descriptions textuelles et les images – modifiez la taille des images – choisissez 2000 étapes d’itération – En général, pour 2000 étapes d’entraînement, cela prend 1 heure avec une carte graphique série 10 et une demi-heure avec une série 30 – Cliquez sur le bouton Training Hypernetwork pour démarrer l’entraînement

5. Présentation des résultats – Après le début de l’entraînement, vous pouvez suivre le processus dans la fenêtre de prévisualisation

– Après l’entraînement, vous pouvez consulter le processus dans … /stable-diffusion-webui/textual_inversion/date/… Vous trouverez les résultats dans le dossier hyper networks – dans le dossier images se trouvent les résultats du processus d’entraînement – Vous pouvez visualiser les images et décider quel résultat d’entraînement est approprié

– dans le dossier hyper networks, les fichiers avec l’extension .pt sont les modèles de style entraînés – Par exemple, si vous trouvez le résultat à l’étape 1400 satisfaisant, vous pouvez déplacer le fichier pt de l’étape 1400 dans models/hyper networks comme style

– Utiliser les résultats d’entraînement pour générer des images – Dans « txt to img » et « img to img », sélectionnez le style que vous venez d’entraîner et générez. – Si le style n’est pas assez marqué, vous pouvez augmenter le facteur

– Amusez-vous bien !
Dernières nouveautés et mon analyse
Stable Diffusion a récemment introduit un nouveau modèle appelé DeepFloyd IF, qui améliore grandement une série de problèmes reprochés au dessin IA. Par exemple, les images générées par l’IA présentent des relations spatiales problématiques, des personnages avec plusieurs doigts sur leurs membres, et l’incapacité à gérer des relations logiques complexes. Franchement, je pense que pour l’IA d’image, l’avenir est du côté de l’open source et du déploiement privé.
La société humaine est diverse et variée au niveau visuel, et des outils avec certains styles et tendances ne peuvent pas couvrir un large spectre. La différence entre les goûts esthétiques humains vient des différents jeux de données d’entraînement, il n’y a pas de différence fondamentale entre humains et IA, et le déploiement privé de l’entraînement pour garantir l’indépendance esthétique, cette « indépendance » peut restaurer un plus grand degré de « diversité ».
Centre de Campagne Zima
Plus à lire

Comment un petit NAS est devenu une archive familiale avec ZimaOS
Une véritable histoire de NAS domestique sur la préservation des dossiers médicaux, des photos de famille, de la musique et des souvenirs quotidiens —...

Journée de la liberté du logiciel 2026 : les meilleures applications open source à auto-héberger chez soi
Découvrez des outils auto-hébergés utiles pour le stockage, la sauvegarde de photos, le streaming média, les documents et la domotique sur un serveur fiable...

Journée mondiale de la photographie : comment sauvegarder et organiser une vie de photos
Rassemblez les photos éparpillées, créez une archive simple, automatisez les sauvegardes, vérifiez la récupération et découvrez quand le stockage centralisé devient intéressant.
