AI-kunst aan de rand: voortgangsrapport Txt2Img-ontwikkeling

Eva Wong is de Technisch Schrijver en en vaste knutselaar bij ZimaSpace. Een levenslange geek met een passie voor homelabs en open-source software, zij is gespecialiseerd in het vertalen van complexe technische concepten naar toegankelijke, praktische handleidingen. Eva gelooft dat zelf-hosting leuk moet zijn, niet intimiderend. Met haar tutorials stelt ze de community in staat om hardware-setup te ontrafelen, van het bouwen van hun eerste NAS tot het beheersen van Docker-containers.

Nu Midjourney door het grote publiek uitgebreid is getest, zijn er enkele problemen met de door AI gegenereerde afbeeldingen vastgesteld. Van een gevoel van verwondering tot het feit dat de afbeeldingen die Midjourney genereert meestal in dezelfde stijl zijn, die je misschien “romig” en te homogeen zou kunnen noemen. Daarnaast worden afbeeldingen van gratis gebruikers blootgesteld aan de rest van de community, en als je een betalende gebruiker bent, kun je niet uitsluiten dat je afbeeldingen voor andere doeleinden “gestolen” worden.

Stable Diffusion komt uit een open-source ecosysteem en met de combinatie van plug-in mogelijkheden en de creativiteit van gebruikers kunnen er meer toepassingsscenario’s worden verkend. Je zult niet tevreden zijn met alleen het genereren van een afbeelding op basis van een beschrijving zoals bij Midjourney; je zult het behandelen als een stijldesigner, en dan begint het leuke en waardevolle werk.

In de community ontdek je veel sterk gestileerde modellen, zoals ChilloutMix voor Japanse manga-stijl, MoXin voor Chinese inktstijl, en zelfs modellen die het gezicht van een filmster imiteren. Je kunt deze trainingsmodellen laden om afbeeldingen te genereren met een hoger niveau van maatwerk. Wanneer het echt commercieel beschikbaar wordt, denk ik dat de markt zich zal verschuiven van Midjourney naar Stable Diffusion.

Wat heb je nodig als je een Stable Diffusion-omgeving zelf wilt hosten?

Hardware voorbereiding

1. Een Windows-computer Bij voorkeur een Windows-computer, Mac-computers kunnen meer problemen ondervinden met grafische kaartdrivers. 2. Een NV GPU van meer dan 6GB Als je wilt trainen, minimaal 12GB videogeheugen.

3. Het werkgeheugen moet meer dan 16GB zijn 8GB is mogelijk, maar het is lastig om de uitstekende modellen uit de community te laden. Bouwproces en voorzorgsmaatregelen.

1. Installeer de Python-omgeving. Zorg er tijdens de installatie voor dat Add Python to PATH is aangevinkt.

2. Installeer de git-omgeving

3. Voer in CMD de volgende opdracht uit om stable-diffusion te downloaden: git clone https://github.com/AUTOMATIC1111/stable-diffusion-webui.git.

4. Start de stable-diffusion web-ui Gebruik de bestandsbeheerder om het gedownloade bestand webui-user.bat te vinden en voer het uit zonder administratorrechten.

5. Open het IP-adres volgens de aanwijzing in de vorige stap, de gebruikersinterface wordt weergegeven – Als er fouten optreden in bovenstaande stappen, kun je GPT vragen om hulp bij het oplossen van het probleem.

Ontwerp een klein doel – een paar afbeeldingen om een klein model te trainen

Een paar belangrijke concepten die je moet begrijpen

hoofdmodel

– Het hoofdmodel dat de outputstijl beïnvloedt, je kunt het originele v1.5-model uit de illustratie gebruiken

– Je kunt een download kiezen die je bevalt op civitai en deze in de opgegeven map plaatsen: …/stable-diffusion-webui/models/Stable-diffusion

promptwoord – Voer de tekstbeschrijving in van de afbeelding die je wilt genereren, bijvoorbeeld Een verweerde Chinese vader die een rijstkom vasthoudt, Speciale kenmerken

Sampling steps – Over het algemeen geldt: hoe hoger het aantal stappen, hoe verfijnder, maar ook hoe langer de wachttijd. Meestal stel ik dit in tussen 20-40.

Lengte en breedte – 512×512 is een redelijke grootte, als je speciale eisen hebt voor de beeldverhouding kun je dit ook aanpassen

genereren – Klik op de genereerknop om het genereren uit te voeren, als je niet tevreden bent, probeer het dan een paar keer

seeds – Als je de huidige compositie goed vindt, kun je deze seed blijven gebruiken bij de volgende generatie door de afbeelding hieronder op te slaan.

geavanceerde opties

Extra – Vink dit vakje aan om de uitgebreide opties te openen – Verschilintensiteit kan de details van de afbeelding vergroten, als je vindt dat de afbeelding te eentonig is, kun je deze waarde verhogen

Stijl aan het model koppelen – Klik op de rode knop “show extra Networks” onder de Genereer-knop om het extra paneel uit te klappen – De miniaturen kunnen worden gedownload van civitai, of je kunt ze zelf trainen.

– Hypernetwerken zijn algemener, en LoRA is meer geschikt voor portretgeneratie

– De mini-modellen worden in de bijbehorende map onder models geplaatst en kunnen worden bekeken en geselecteerd

– Na het selecteren van een “stijl” worden de parameters van de stijl aan de prompt toegevoegd, en de parameters erna geven de concentratie aan

Acties om het mini-doel te bereiken (training)

1. Bereid de trainingsset voor

– Ongeveer 20 afbeeldingen zijn voldoende om een mooi klein stijltje te trainen – als begin is 5 afbeeldingen met een specifieke stijl ook prima – de grootte van de afbeeldingen in de trainingsset moet identiek zijn 2. Maak een Hypernetwork aan – Voer tijdens het trainen een naam in om een hypernetwerk te creëren

3. Verwerk de afbeeldingen voor – In deze stap genereert de AI eerst een tekstbeschrijving op basis van de trainingsafbeelding. – Vul bij de voorbewerkte afbeelding het mapadres in van de trainingsafbeeldingen en het mapadres van de output van de voorbewerkte afbeeldingen. – Pas de beeldverhouding van de trainingsafbeeldingen aan – Als de grootte niet hetzelfde is, kun je eerst met Birme de afbeeldingsgrootte in batch aanpassen. – Vink de BLIP-optie aan en klik op de Preprocess-knop om de voorbewerking uit te voeren

Wacht tot er voor elke trainingsafbeelding een txt-bestand is aangemaakt, de tekst is de beschrijving van de bijbehorende afbeelding Er kunnen onnauwkeurigheden in de beschrijvingen zitten, die kun je handmatig aanpassen – De nauwkeurigheid van de beschrijvingen bepaalt tot op zekere hoogte de effectiviteit van de training

4. Training – Selecteer tijdens het trainen het zojuist aangemaakte Hypernetwork. 2. Voer een leersnelheid van 0.00005 in – In de beginfase van de training zijn 4 nullen geschikt, in latere training verlaag je het aantal nullen geleidelijk – Voer de map in met tekstbeschrijvingen en afbeeldingen Pas de afbeeldingsgrootte aan Kies 2000 iteratiestappen Over het algemeen duurt 2000 stappen trainen ongeveer 1 uur op een grafische kaart uit de 10-serie en een half uur op een 30-serie grafische kaart Klik op de knop Training Hypernetwork om te starten

5. ResultaatweergaveNa het starten van de training kun je het trainingsproces zien in het preview-venster

Na de training kun je het trainingsproces terugvinden in … /stable-diffusion-webui/textual_inversion/date/… Je vindt de trainingsresultaten in de hypernetworks-map In de images-map staan de resultaten van het trainingsproces Je kunt de afbeeldingen bekijken en bepalen welk trainingsresultaat geschikt is

In de hypernetworks-map zijn de bestanden met de .pt-extensie de getrainde stijlen – Bijvoorbeeld, als je het resultaat van stap 1400 geschikt vindt, kun je het pt-bestand van stap 1400 verplaatsen naar models/hypernetworks als stijl

Gebruik de trainingsresultaten om afbeeldingen te genereren Selecteer in “txt to img” en “img to img” de zojuist getrainde stijl en genereer. Als de stijl niet sterk genoeg is, kun je de factor verhogen

Veel plezier!

Recentelijk net uitgebracht: de nieuwste ontwikkelingen en mijn inzichten

Onlangs heeft Stable Diffusion een nieuw model geïntroduceerd genaamd DeepFloyd IF, dat een reeks problemen met de bekritiseerde AI-tekeningen sterk verbetert. Bijvoorbeeld problemen met ruimtelijke relaties in AI-gegenereerde afbeeldingen, personages met meerdere vingers aan hun ledematen, en het onvermogen om complexe logische relaties te verwerken. Eerlijk gezegd geloof ik dat de toekomst van beeld-AI ligt aan de kant van open source en private implementatie.

De menselijke samenleving is visueel divers en verschillend, en tools met bepaalde stijlen en neigingen kunnen niet een groot gebied bestrijken. Het verschil tussen mensen en hun esthetische voorkeuren komt door verschillende trainingssets, er is geen verschil tussen mensen en AI, en private implementatie van training om de onafhankelijkheid van esthetiek te waarborgen, kan een grotere mate van “diversiteit” herstellen.

Zima Campagnecentrum

Meer om te lezen

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.