AI-konst på kanten: Rapport om utvecklingsframsteg för Txt2Img

Eva Wong är Teknisk skribent och den boende fixaren på ZimaSpace. En livslång nörd med en passion för hemma-labb och öppen källkod, hon specialiserar sig på att översätta komplexa tekniska koncept till tillgängliga, praktiska guider. Eva tror att självhosting ska vara roligt, inte skrämmande. Genom sina handledningar ger hon gemenskapen verktyg att avmystifiera hårdvaruinstallationer, från att bygga sin första NAS till att bemästra Docker-containrar.

Eftersom Midjourney har testats och använts brett av allmänheten har vissa problem med AI-genererade bilder identifierats, från en känsla av förundran till det faktum att bilderna som genereras av Midjourney oftast tenderar att ha samma stil, som man kan kalla ”krämig” och för homogen, samt att Midjourney inte har någon sekretess för gratisanvändare vars bilder exponeras för resten av communityn, och för betalande användare kan man inte utesluta risken att deras bilder ”stjäls” för andra ändamål.

Stable Diffusion kommer från ett open-source-ekosystem, och med kombinationen av plug-in-funktioner och användarnas kreativitet kan fler användningsområden utforskas. Du nöjer dig inte med att bara generera en bild utifrån en beskrivning som Midjourney, utan du behandlar det som en stildesigner, och det är då det roliga och värdefulla börjar.

I communityn kan du utforska många högst stiliserade modeller, som ChilloutMix för japansk mangastil, MoXin för kinesisk bläckstil, och till och med modeller som imiterar ansiktet på en filmstjärna. Du kan ladda dessa träningsmodeller för att generera bilder med högre grad av anpassning. När det verkligen når kommersiell tillgänglighet tror jag att marknadens fokus kommer att skifta från Midjourney till Stable Diffusion.

Vad behöver du om du vill självhosta en Stable Diffusion-miljö?

Hårdvaruförberedelser

1. En Windows-dator Helst en Windows-dator, Mac-datorer kan stöta på fler problem med grafikkortsdrivrutiner. 2. Ett NV-grafikkort med mer än 6GB Om du vill träna behöver du minst 12GB videominne.

3. Minne över 16GB 8GB minne fungerar, men det är svårt att ladda de bästa modellerna i communityn.

Byggprocess och försiktighetsåtgärder.

1. Installera Python-miljön. Under installationen, se till att Lägg till Python i PATH är markerat.

2. Installera git-miljön.

3. I CMD, kör följande kommando för att ladda ner stable-diffusion: git clone https://github.com/AUTOMATIC1111/stable-diffusion-webui.git.

4. Starta stable-diffusion web-ui Använd filhanteraren för att hitta den nedladdade filen webui-user.bat och kör den utan administratörsrättigheter.

5. Följ instruktionerna i föregående steg, öppna IP-adressen och användargränssnittet visas – Om det uppstår fel i ovanstående steg kan du be GPT om hjälp att lösa problemet.

Designa ett litet mål – några bilder för att träna en liten modell

Några viktiga begrepp du behöver förstå

huvudmodell

– Huvudmodellen som påverkar utmatningsstilen, du kan använda originalmodellen v1.5 i illustrationen

– Du kan välja en nedladdning du är nöjd med på civitai och placera den i den angivna mappen …/stable-diffusion-webui/models/Stable-diffusion

promptord – Ange textbeskrivningen av bilden du vill generera, till exempel En väderbiten kinesisk far som håller en ris-skål, Särskilda egenskaper

Samplingsteg – Generellt gäller att ju fler steg, desto mer förfinad bild, men längre väntetid. Jag brukar sätta det mellan 20-40.

Längd och bredd – 512×512 är en rimlig storlek, om du har särskilda krav på bildförhållandet kan du också ändra det.

generera – Klicka på generera-knappen för att starta genereringen, om du inte är nöjd första gången, försök flera gånger.

frön – Om du tycker att den genererade kompositionen är bra kan du fortsätta använda detta frö vid nästa generering genom att spara bilden nedan.

avancerade alternativ

Extra – Klicka i denna kryssruta för att öppna utökade alternativ – Skillnadsintensitet kan öka bildens detaljrikedom, om du tycker bilden är för enformig kan du öka detta värde.

Bifoga stil till modellen – Klicka på den röda knappen ”show extra Networks” under Generera-knappen för att expandera den extra panelen – Miniatyrerna kan laddas ner från civitai, eller så kan du träna dem själv.

– Hypernetwork är mer universellt, och LoRA passar bättre för porträttgenerering.

– Mini-modellerna placeras i motsvarande mapp under models och kan ses och väljas.

– Efter att ha valt ”stil” läggs stilens parametrar till i prompten, och parametern efter representerar koncentrationen.

Åtgärder för att uppnå mini-målet (träning)

1. Förbered träningsdatasetet

– Cirka 20 bilder räcker för att träna en fin liten stilmodell – som start räcker 5 bilder med en specifik stil – storleken på bilderna i träningsdatasetet måste vara identisk. 2. Skapa Hypernetwork – Under träningen, ange ett namn för att skapa ett hypernätverk.

3. Förbehandla bilderna – I detta steg genererar AI först en textbeskrivning baserat på träningsbilden. – I förbehandlade bilder fyller du i mappadressen för träningsbilderna och mappadressen för de förbehandlade bilderna. – Ändra bildens storlek – Om storleken inte är densamma kan du använda Birme för att batch-ändra bildstorleken först. – Markera BLIP-alternativet och klicka på Förbehandla-knappen för att utföra förbehandlingen.

vänta tills varje träningsbild har en tillhörande txt-fil, texten är beskrivningen av motsvarande bild det kan finnas felaktigheter i beskrivningarna, du kan ändra dem manuellt – Beskrivningarnas noggrannhet påverkar träningsresultatets effektivitet till viss del.

4. Träning – Välj det Hypernetwork du just skapade under träningen. 2. Ange inlärningshastighet 0.00005 – Vid initial träning är 4 nollor lämpligt, minska antalet nollor gradvis vid senare träning – Ange katalogen med textbeskrivningar och bilder Ändra bildstorlek Välj 2000 iterativa steg Generellt tar 2000 steg cirka 1 timme med ett grafikkort i 10-serien och en halvtimme med ett i 30-serien Klicka på knappen Training Hypernetwork för att starta träningen.

5. Resultatpresentation Efter att träningen startat kan du se träningsprocessen i förhandsgranskningsfönstret.

Efter träningen kan du se träningsprocessen i … /stable-diffusion-webui/textual_inversion/date/… Du kan hitta träningsresultaten i hyper networks-mappen I images-mappen finns resultaten från träningsprocessen Du kan granska bilderna och avgöra vilket träningsresultat som är lämpligt.

I hyper networks-mappen är filerna med .pt-suffix träningsstilmodellerna – Om du tycker att resultatet vid steg 1400 är lämpligt kan du flytta pt-filen från steg 1400 till models/hyper networks som stil.

Använd träningsresultaten för att generera bilder I ”txt to img” och ”img to img” väljer du den stil du just tränat och genererar. Om stilen inte är tillräckligt stark kan du öka faktorn.

Ha kul!

Senaste nyheter och min förståelse

Stable Diffusion har nyligen introducerat en ny modell kallad DeepFloyd IF, som kraftigt förbättrar en rad problem med den kritiserade AI-ritningen. Till exempel problem med rumsliga relationer i AI-genererade bilder, karaktärer med flera fingrar på sina lemmar och oförmågan att hantera komplexa logiska samband. Ärligt talat tror jag att för bild-AI ligger framtiden på öppen källkod och privat drift.

Människosamhället är mångfacetterat och varierande på visuell nivå, och verktyg med vissa stilar och tendenser kan inte täcka ett stort område. Skillnaden mellan människors estetiska preferenser beror på olika träningsdataset, det finns ingen skillnad mellan människor och AI i detta avseende, och privat träning för att säkerställa estetisk självständighet kan återställa en större grad av ”mångfald”.

Zima Kampanjnav

Mer att läsa

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.