Tensorparallellism delar upp lokal AI-inferens genom att fördela stora vikt-tensorer i varje transformerlager över flera GPU:er och kombinera deras delresultat.
Det skiljer sig från att ge varje GPU en separat förfrågan eller tilldela olika lager till olika enheter. Varje tensorparallell GPU deltar i samma lager, ofta för varje genererad token. Metoden kan göra att en modell får plats över flera GPU:er hemma, men den gör kommunikation mellan GPU:er till en del av den kritiska inferensvägen.
Tensorparallellism delar upp ett lager i stället för att kopiera hela modellen
Dataparallellism ger varje GPU en modellkopia och delar upp förfrågningar eller batcher. Tensorparallellism gör tvärtom för en enskild modell: den delar upp stora parametertensorer i enskilda lager mellan enheter.
NVIDIA NeMo definierar TP som att fördela enskilda lagers parametertensor över GPU:er. Varje GPU innehåller endast en del av den berörda matrisen.
Detta är användbart när en modell, eller till och med ett enda stort lager, inte får plats bekvämt på en enda GPU hemma.
Kolumn- och radpartitioner delar upp arbetet med matrismultiplikation
Transformerlager innehåller stora linjära projektioner. En kolumnparallell uppdelning tilldelar olika utdatakolumner till olika GPU:er, medan en radparallell uppdelning tilldelar olika indata-rader eller funktionsintervall.
PyTorchs tensorparallella handledning tillämpar radvisa och kolumnvisa parallella metoder på transformerlager. Varje rank beräknar en partiell matrismultiplikation från sin lokala viktpartition.
Modellen representerar fortfarande ett enda logiskt lager. Uppdelningen ändrar var delar av matematiken utförs och hur delresultaten kombineras.
Kollektiv kommunikation återskapar lagrets logiska utdata
Eftersom varje GPU endast ser en del av tensorn behöver vissa operationer all-reduce, all-gather, reduce-scatter eller motsvarande kollektiva operationer innan nästa beräkning har den representation som krävs.
Open MPI definierar AllReduce som att kombinera värden över processer och distribuera resultatet tillbaka till alla deltagare. Tensorparallella körmiljöer använder denna typ av kollektiv operation, tillsammans med all-gather och reduce-scatter, för att återskapa eller omfördela resultaten från partitionerade lager.
På en arbetsstation hemma kan kvaliteten på anslutningen mellan GPU:erna avgöra om uppdelningen sparar tid eller bara ökar kapaciteten.
Snabba sammankopplingar är viktiga eftersom kommunikationen sker för varje lager
Tensorparallellism kan kräva flera kollektiva operationer för varje transformerblock och varje genererad token. System som endast använder PCIe har betydligt lägre bandbredd mellan enheter än avancerade acceleratorfabriker som är utformade för stora distribuerade jobb.
AMD RCCL dokumenterar peer-to-peer-transport för PCIe-anslutna GPU:er. Det exakta biblioteket för kollektiva operationer varierar mellan plattformar, men samma topologiska begränsning gäller.
Två GPU:er med tillräckligt mycket sammanlagt VRAM kan köra en större modell utan problem, men ändå ge lägre tokenhastighet än väntat eftersom varje lager väntar på synkronisering.
GPU:er med olika prestanda kan göra att den långsammaste partitionen bestämmer takten
Ett tensorparallellt lager går vidare först när de nödvändiga delresultaten har kommit fram. Om en GPU har lägre beräkningskapacitet, lägre minnesbandbredd eller en långsammare länk kan den snabbare ranken behöva vänta.
Deepspeeds automatiska funktion för tensorparallell inferens är utformad kring modellpartitionering över en inferensprocessgrupp. Den praktiska effektiviteten förutsätter att de deltagande enheterna kan bidra med balanserat arbete.
En blandad samling GPU:er hemma kan fortfarande vara användbar för att få plats med modellen, men lika stora partitioner är inte automatiskt optimala när hårdvaran skiljer sig avsevärt.
Välj tensorparallellism för breda lager och begränsat minne på en enda GPU
Det starkaste användningsfallet är en modell vars stora dolda dimensioner och lagertensorer behöver delas upp över flera GPU:er, särskilt när enheterna har en snabb lokal sammankoppling. Det är inte automatiskt det bästa sättet att hantera flera oberoende mindre förfrågningar.
ZimaSpaces artikel om minnesplanering för lokala AI-acceleratorer ger en kapacitetsbaslinje; tensorparallellism förändrar den baslinjen genom att fördela en modells lager över flera enheter.
Benchmarka en GPU när det är möjligt och därefter två eller fler med samma modell, prompt, kontext och batch. Registrera minnesanvändning per GPU, token per sekund, latens, tid för kollektiva operationer och länkens utnyttjandegrad.
ZimaSpaces artikel om lokal AI-belastning för flera användare är jämförelsen ur ett serveringsperspektiv: TP gör att en modell spänner över flera enheter, medan samtidiga förfrågningar avgör hur många oberoende kontexter som konkurrerar om den distribuerade modellen.
Teknik- och AI-hubb
Mer att läsa

Why Plex May Re-Analyze Media After a Server Upgrade
Plex may re-analyze media after an upgrade. Separate finite maintenance work from repeated scans, path issues, or database faults.

What Actually Sets the Plex Performance Ceiling?
A dependency model for Plex performance that helps you identify the first saturated stage instead of upgrading every component at once.

Plex Networking Explained: Discovery, DNS, Routing, and Remote Reachability
A layer-by-layer model of Plex reachability that separates local discovery from IP routing and remote NAT or port-forwarding problems.

