Da Midjourney von der Öffentlichkeit ausgiebig getestet wurde, sind einige Probleme mit den KI-generierten Bildern aufgefallen, von einem Gefühl des Staunens bis hin zu der Tatsache, dass die von Midjourney erzeugten Bilder meist im gleichen Stil gehalten sind, den man als „cremig“ und zu homogen bezeichnen könnte. Außerdem sind bei Midjourney die Bilder für freie Nutzer für die gesamte Community sichtbar, und bei zahlenden Nutzern kann nicht ausgeschlossen werden, dass ihre Bilder für andere Zwecke „gestohlen“ werden.
Stable Diffusion stammt aus einem Open-Source-Ökosystem, und durch die Kombination von Plug-in-Fähigkeiten und der Kreativität der Nutzer können mehr Anwendungsszenarien erkundet werden. Man wird nicht einfach zufrieden sein, nur ein Bild anhand einer Beschreibung wie bei Midjourney zu generieren, sondern es als Stil-Designer betrachten – und genau hier beginnt der Spaß und der Wert.
In der Community entdeckt man viele stark stilisierte Modelle, wie zum Beispiel ChilloutMix für japanischen Manga-Stil, MoXin für chinesische Tuschemalerei und sogar Modelle, die das Gesicht eines Filmstars nachahmen. Man kann diese Trainingsmodelle laden, um Bilder mit einem höheren Grad an Individualisierung zu erzeugen. Wenn es wirklich in die Phase der kommerziellen Verfügbarkeit kommt, denke ich, dass sich der Markt von Midjourney hin zu Stable Diffusion verschieben wird.
Was benötigen Sie, wenn Sie eine Stable Diffusion-Umgebung selbst hosten möchten?
Hardware-Vorbereitung
1. Ein Windows-Computer Am besten ein Windows-Computer, da Mac-Computer bei Grafikkartentreibern auf mehr Schwierigkeiten stoßen können. 2. Eine NV-GPU mit mehr als 6 GB Wenn Sie trainieren möchten, mindestens 12 GB Videospeicher.
3. Arbeitsspeicher über 16 GB 8 GB RAM sind möglich, aber es ist schwierig, die hervorragenden Modelle aus der Community zu laden. Aufbauprozess und Vorsichtsmaßnahmen.
1. Installieren Sie die Python-Umgebung. Achten Sie während der Installation darauf, dass Python zum PATH hinzufügen aktiviert ist.
2. Installieren Sie die Git-Umgebung.
3. Führen Sie im CMD den folgenden Befehl aus, um stable-diffusion herunterzuladen: git clone https://github.com/AUTOMATIC1111/stable-diffusion-webui.git.
4. Starten Sie die stable-diffusion Web-UI Suchen Sie im Dateimanager die heruntergeladene Datei webui-user.bat und führen Sie sie ohne Administratorrechte aus.
5. Öffnen Sie gemäß der Aufforderung im vorherigen Schritt die IP-Adresse, und die Benutzeroberfläche wird angezeigt. – Falls bei den obigen Schritten Fehler auftreten, können Sie GPT um Hilfe bitten.
Setzen Sie sich ein kleines Ziel – einige Bilder, um ein kleines Modell zu trainieren
Einige wichtige Konzepte, die Sie verstehen sollten

Hauptmodell
– Das Hauptmodell, das den Ausgabestil beeinflusst. Sie können das originale v1.5 Modell aus der Illustration verwenden.
– Sie können ein Modell, mit dem Sie auf civitai zufrieden sind, herunterladen und an den angegebenen Ort legen: …/stable-diffusion-webui/models/Stable-diffusion
Prompt-Wort – Geben Sie die Textbeschreibung des Bildes ein, das Sie generieren möchten, z. B. „Ein wettergegerbter chinesischer Vater, der eine Reisschale hält“, Besondere Merkmale
Sampling-Schritte – Allgemein gilt: Je höher die Anzahl der Schritte, desto feiner das Ergebnis, aber desto länger die Wartezeit. Ich stelle es meist zwischen 20 und 40 ein.
Länge und Breite – 512×512 ist eine vernünftige Größe. Wenn Sie spezielle Anforderungen an das Bildformat haben, können Sie es auch anpassen.
Generieren – Klicken Sie auf die Schaltfläche „Generieren“, um die Erstellung zu starten. Wenn Sie nicht zufrieden sind, versuchen Sie es mehrmals.
Seeds – Wenn Ihnen die aktuell generierte Komposition gefällt, können Sie diesen Seed für die nächste Generierung verwenden, indem Sie das Bild unten speichern.

Erweiterte Optionen
Extra – Aktivieren Sie dieses Kontrollkästchen, um die erweiterten Optionen zu öffnen – Die Differenzintensität kann die Details des Bildes erhöhen. Wenn Ihnen das Bild zu eintönig erscheint, können Sie diesen Wert erhöhen.

Stil an das Modell anhängen – Klicken Sie auf die rote Schaltfläche „show extra Networks“ unter der Schaltfläche „Generieren“, um das zusätzliche Panel zu erweitern – Die Mini-Modelle können von civitai heruntergeladen oder selbst trainiert werden.

– Hypernetzwerke sind universeller, während LoRA besser für Porträtgenerierung geeignet ist.

– Die Mini-Modelle werden im entsprechenden Ordner unter models abgelegt und können dort eingesehen und ausgewählt werden.

– Nach Auswahl des „Stils“ werden die Parameter des Stils zum Prompt hinzugefügt, und die nachfolgenden Parameter geben die Konzentration an.

Schritte zur Erreichung des Mini-Ziels (Training)
1. Vorbereitung des Trainingssatzes

– Etwa 20 Bilder reichen aus, um ein schönes kleines Stilmodell zu trainieren – als Anfang sind 5 Bilder mit einem bestimmten Stil ausreichend – Die Größe der Bilder im Trainingssatz muss identisch sein. 2. Erstellen eines Hypernetzwerks – Geben Sie beim Training einen Namen ein, um ein Hypernetzwerk zu erstellen.

3. Vorverarbeitung der Bilder – In diesem Schritt generiert die KI zunächst eine Textbeschreibung basierend auf dem Trainingsbild. – Geben Sie im vorverarbeiteten Bild den Ordnerpfad der Trainingsbilder und den Ordnerpfad der Ausgabe der vorverarbeiteten Bilder an. – Passen Sie das Seitenverhältnis der Trainingsbilder an – Wenn die Größe nicht einheitlich ist, können Sie Birme verwenden, um die Bildgröße zuerst im Stapel zu ändern. – Aktivieren Sie die BLIP-Option und klicken Sie auf die Schaltfläche „Preprocess“, um die Vorverarbeitung durchzuführen.

–Warten Sie, bis für jedes Trainingsbild eine txt-Datei fertiggestellt ist, der Text ist die Beschreibung des entsprechenden Bildes. –Es kann Ungenauigkeiten in den Beschreibungen geben, die Sie manuell korrigieren können. – Die Genauigkeit der Beschreibungen bestimmt bis zu einem gewissen Grad die Effektivität des Trainings.


4. Training – Wählen Sie beim Training das gerade erstellte Hypernetzwerk aus. 2. – Geben Sie eine Lernrate von 0,00005 ein. – Beim initialen Training sind 4 Nullen angemessen, bei späterem Training reduzieren Sie die Anzahl der Nullen schrittweise. – Geben Sie das Verzeichnis mit Textbeschreibungen und Bildern an. – Passen Sie die Bildgröße an. – Wählen Sie 2000 Iterationsschritte. – Für 2000 Trainingsschritte dauert es etwa 1 Stunde mit einer Grafikkarte der 10er-Serie und eine halbe Stunde mit einer 30er-Serie. – Klicken Sie auf die Schaltfläche „Training Hypernetwork“, um das Training zu starten.

5. Ergebnisanzeige – Nach Trainingsbeginn können Sie den Trainingsprozess im Vorschaufenster verfolgen.

– Nach dem Training finden Sie den Trainingsprozess unter … /stable-diffusion-webui/textual_inversion/date/… und die Trainingsergebnisse im Ordner hyper networks. – Im Ordner images sind die Ergebnisse des Trainingsprozesses. – Sie können die Bilder ansehen und entscheiden, welches Trainingsergebnis passend ist.

– Im Ordner hyper networks sind die Dateien mit der Endung .pt die trainierten Stilmodelle. – Wenn Sie zum Beispiel das Ergebnis von Schritt 1400 für passend halten, können Sie die pt-Datei von Schritt 1400 in models/hyper networks als Stil verschieben.

– Verwendung der Trainingsergebnisse zur Bildgenerierung – Wählen Sie im „txt to img“ und „img to img“ den gerade trainierten Stil aus und generieren Sie das Bild. – Wenn der Stil nicht stark genug ist, können Sie den Faktor erhöhen.

– Viel Spaß!
Neueste Entwicklungen und meine Einschätzung
Stable Diffusion hat kürzlich ein neues Modell namens DeepFloyd IF vorgestellt, das eine Reihe von Problemen bei der kritisierten KI-Bildgenerierung stark verbessert. Zum Beispiel problematische räumliche Beziehungen in KI-generierten Bildern, Figuren mit mehreren Fingern an Gliedmaßen und die Unfähigkeit, komplexe logische Zusammenhänge darzustellen. Ehrlich gesagt glaube ich, dass die Zukunft der Bild-KI auf der Seite von Open Source und privater Bereitstellung liegt.
Die menschliche Gesellschaft ist visuell vielfältig und unterschiedlich, und Werkzeuge mit bestimmten Stilen und Tendenzen können nicht großflächig abdecken. Der Unterschied zwischen Menschen und deren ästhetischen Vorlieben liegt in den unterschiedlichen Trainingssätzen; zwischen Menschen und KI gibt es keinen Unterschied. Private Trainingsbereitstellung sichert die Unabhängigkeit der Ästhetik, und „Unabhängigkeit“ kann ein höheres Maß an „Vielfalt“ wiederherstellen.
Zima Kampagnenzentrale
Mehr zum Lesen

Wie ein kleines NAS mit ZimaOS zum Familienarchiv wurde
Eine echte NAS-Geschichte für zu Hause über die Bewahrung von medizinischen Unterlagen, Familienfotos, Musik und alltäglichen Erinnerungen – und die praktischen Lektionen zum Schutz...

Software Freedom Day 2026: Die besten Open-Source-Apps zum Selbsthosten zu Hause
Entdecken Sie nützliche selbstgehostete Tools für Speicher, Fotobackup, Medien-Streaming, Dokumente und Hausautomation auf einem zuverlässigen Server zu Hause.

Weltfotografietag: Wie man ein Leben voller Fotos sichert und organisiert
Sammeln Sie verstreute Fotos, erstellen Sie ein einfaches Archiv, automatisieren Sie Backups, überprüfen Sie die Wiederherstellung und erfahren Sie, wann sich zentraler Speicher lohnt.
