I migliori modelli di IA da eseguire localmente su hardware consumer

Eva Wong è la Technical Writer e smanettatrice residente di ZimaSpace. Una geek da sempre con una passione per homelab e software open-source, si specializza nel tradurre concetti tecnici complessi in guide accessibili e pratiche. Eva crede che l'auto-ospitare debba essere divertente, non intimidatorio. Attraverso i suoi tutorial, dà potere alla comunità di demistificare le configurazioni hardware, dalla costruzione del loro primo NAS al dominio dei container Docker.

Qwen3.5-9B è il miglior modello IA locale a tutto tondo per la maggior parte dei PC consumer nel 2026.

La scelta migliore può comunque variare in base al tuo carico di lavoro: i modelli compatti sono più veloci su CPU e laptop, i modelli da 8B–14B offrono in genere il miglior equilibrio tra qualità e memoria, mentre i modelli più grandi o basati su mixture of experts sono adatti quando la precisione nella programmazione, nel ragionamento o nelle attività multimodali conta più della velocità.

Il confronto seguente usa come riferimento implementazioni pratiche a 4 bit, così puoi abbinare un modello alla RAM o alla VRAM che già possiedi prima di scaricare decine di gigabyte di pesi.

Confronto tra modelli IA locali: la rosa dei candidati

Posizione Modello Ideale per Ingombro approssimativo a 4 bit Hardware pratico per iniziare Compromesso principale
1 Qwen3.5-9B Migliore in assoluto 6–8 GB 16 GB di RAM o 8–12 GB di VRAM I contesti lunghi richiedono molta più memoria
2 Gemma 4 12B Attività multimodali 9–12 GB 24 GB di RAM o 12–16 GB di VRAM Più pesante dei modelli solo testuali
3 gpt-oss-20b Ragionamento locale Circa 16 GB in MXFP4 16 GB di memoria unificata o VRAM Richiede hardware consumer di fascia alta
4 Ministral 3 14B Instruct Agenti e utilizzo di strumenti 9–12 GB 24 GB di RAM o 12–16 GB di VRAM Più lento dei modelli 8B–9B più piccoli
5 Qwen3-Coder-30B-A3B Programmazione locale 18–22 GB 32 GB di RAM o 24 GB di VRAM Il peso complessivo dei parametri rimane elevato nonostante i 3,3 miliardi di parametri attivi
6 DeepSeek-R1-Distill-Qwen-14B Ragionamento economico 9–11 GB 24 GB di RAM o 12–16 GB di VRAM L’output del ragionamento può essere prolisso e lento
7 Qwen3-VL-8B Instruct Immagini e documenti 7–10 GB inclusi i componenti per la visione 16–24 GB di RAM o 12 GB di VRAM La risoluzione delle immagini influisce sull’uso della memoria
8 Phi-4 Mini Instruct Ragionamento su dispositivi compatti 3–5 GB 8–16 GB di RAM o 6 GB di VRAM Conoscenze meno ampie rispetto ai modelli più grandi
9 Gemma 3n E4B IA multimodale per dispositivi mobili e con risorse limitate 4–7 GB 8–16 GB di RAM unificata Il supporto del runtime varia a seconda della piattaforma
10 Llama 3.2 3B Instruct Ampia compatibilità con l’ecosistema 2–4 GB 8 GB di RAM o 4–6 GB di VRAM Più vecchio e meno capace dei modelli piccoli più recenti

I dati sulla memoria sono stime utili per la pianificazione, non garanzie. Presuppongono, quando disponibile, una build pratica a 4 bit e una finestra di contesto moderata. L’overhead del runtime, la cache KV, gli encoder per la visione, la dimensione del batch e l’offloading sulla GPU possono aggiungere diversi gigabyte.

Come abbiamo scelto i migliori modelli per l’uso locale

Questa non è una classifica basata esclusivamente sui benchmark. Un modello che vince un test ma non può essere eseguito sulla tua macchina non è il miglior modello locale per te. Abbiamo dato priorità a cinque fattori: qualità dell’output utile, compatibilità realistica con l’hardware consumer, disponibilità di runtime locali o build quantizzate, varietà di attività supportate e complessità di licenza o accesso.

Abbiamo inoltre considerato in senso ampio l’“hardware consumer”: PC Windows e Linux, Mac con Apple Silicon, server domestici compatti e homelab incentrati sui NAS. Se scegli prima i componenti, usa la nostra guida all’hardware economico per server IA locali per dimensionare il sistema completo, invece di concentrarti solo sulla memoria della GPU.

1. Qwen3.5-9B — Il miglior modello di IA locale in assoluto

Qwen3.5-9B è la raccomandazione più equilibrata per un computer moderno con 16 GB o una GPU da 8–12 GB. È abbastanza piccolo da funzionare in un formato quantizzato pratico, ma sufficientemente capace per chat, riepiloghi, generazione aumentata dal recupero, attività multilingue e programmazione leggera.

La scheda ufficiale del modello indica una finestra di contesto nativa di 262.144 token, ma questo valore non dovrebbe diventare l’impostazione locale predefinita. La cache KV cresce con il contesto, quindi inizia da circa 8K–16K e aumenta solo quando il carico di lavoro lo giustifica. In questo modo mantieni sotto controllo latenza e utilizzo della memoria.

  • Sceglilo se: vuoi un modello generico per l’uso locale quotidiano.
  • Evitalo se: il tuo obiettivo principale è la generazione di codice avanzata o la comprensione di audio e video.
  • Punto ideale: quantizzazione a 4 bit su una GPU da 12 GB, oppure inferenza ibrida CPU/GPU con 16–24 GB di RAM di sistema.

2. Gemma 4 12B — Ideale per l’IA multimodale locale

Gemma 4 12B è la scelta più potente quando per “IA locale” si intende qualcosa di più del semplice testo. La scheda del modello di Google descrive input nativi di testo, immagini, audio e video, una finestra di contesto fino a 256K, supporto multilingue per oltre 140 lingue e un’architettura pensata per un’esecuzione locale semplificata.

Presentazione di Gemma 4 12B

Questa versatilità comporta un maggiore impiego di risorse. Prevedi 24 GB di RAM di sistema o 12–16 GB di VRAM per un’implementazione quantizzata confortevole, lasciando poi ulteriore margine per gli input multimediali. È particolarmente utile per l’analisi privata delle foto, la comprensione dei documenti, i flussi di lavoro con contenuti multimediali delle riunioni e la ricerca multimodale.

  • Sceglilo se: ti serve un unico modello in grado di comprendere testo e contenuti multimediali.
  • Evitalo se: ti serve solo una chat testuale veloce su un portatile con 8 GB.
  • Punto ideale: 16 GB di VRAM o 32 GB di memoria unificata.

3. gpt-oss-20b — Ideale per il ragionamento di alta qualità su una GPU consumer

gpt-oss-20b è destinato ai dispositivi consumer di fascia alta. OpenAI afferma che può funzionare con 16 GB di memoria, mentre la sua guida ufficiale per Ollama raccomanda almeno 16 GB di VRAM o di memoria unificata per il modello più piccolo.

GPT-OSS 120B e 20B: spiegazione dei modelli di ragionamento OpenAI con pesi aperti | di Servifyspheresolutions | Medium

È particolarmente adatto a chi desidera un ragionamento ponderato, output strutturati o sperimentazione locale senza passare a GPU di classe workstation. Il limite pratico è che 16 GB rappresentano un punto di partenza, non un margine abbondante: contesti lunghi, richieste parallele o formati diversi da MXFP4 possono aumentare il consumo di memoria.

  • Sceglilo se: la qualità del ragionamento conta più della bassa latenza.
  • Evitalo se: hai solo 8 GB di VRAM o ti affidi esclusivamente all'inferenza su CPU.
  • Punto ideale: una GPU da 16–24 GB o un sistema Apple Silicon con almeno 24 GB di memoria unificata.

4. Ministral 3 14B Instruct — Il migliore per agenti locali e uso degli strumenti

Ministral 3 14B Instruct combina testo e visione con chiamate di funzione native, output JSON, supporto multilingue e una forte aderenza al prompt di sistema. Mistral posiziona la famiglia per l'implementazione edge e segnala che il modello 14B rientra in 24 GB di VRAM in FP8, con requisiti inferiori dopo un'ulteriore quantizzazione.

Esegui Ministral-3 3B localmente: un modello compatto ed efficiente con visione

Per un assistente domestico privato che utilizza strumenti di ricerca, automazione o gestione dei file, queste funzioni di affidabilità possono contare più di un piccolo vantaggio nei benchmark. Una versione a 4 bit dovrebbe funzionare su hardware con meno memoria, ma 12–16 GB di VRAM offrono un intervallo operativo più confortevole.

  • Sceglilo se: stai creando agenti che usano strumenti o workflow strutturati.
  • Evitalo se: la tua priorità è ottenere il massimo numero di token al secondo su una GPU entry-level.
  • Punto ideale: 16 GB di VRAM e una finestra di contesto moderata.

5. Qwen3-Coder-30B-A3B Instruct — Miglior modello locale per la programmazione

Qwen3-Coder-30B-A3B Instruct è progettato specificamente per la programmazione agentica, la comprensione di repository su larga scala e le chiamate di funzione. La sua architettura mixture-of-experts contiene 30,5 miliardi di parametri totali, ma ne attiva circa 3,3 miliardi per token, migliorando l'efficienza di calcolo senza eliminare la necessità di archiviare tutti i pesi quantizzati.

Qwen/Qwen3-Coder-30B-A3B-Instruct · Hugging Face

Questa distinzione è importante per la pianificazione dell'hardware. Una build a 4 bit è generalmente adatta a una GPU da 24 GB o a una macchina con almeno 32 GB di memoria di sistema. Il contesto nativo da 256K è interessante per repository di grandi dimensioni, ma gli utenti locali dovrebbero iniziare con valori più piccoli, perché il contesto del codice può consumare rapidamente la memoria della cache KV.

  • Sceglilo se: la programmazione è il carico di lavoro principale e disponi di 24 GB di memoria grafica.
  • Evitalo se: vuoi un assistente leggero per l'uso quotidiano.
  • Punto ideale: 24 GB di VRAM, archiviazione NVMe veloce e 64 GB di RAM di sistema per avere margine.

6. DeepSeek-R1-Distill-Qwen-14B — Il miglior modello di ragionamento economico

DeepSeek-R1-Distill-Qwen-14B comprime gli schemi di ragionamento appresi da DeepSeek-R1 in un checkpoint denso da 14B basato su Qwen2.5. Rimane un'opzione pratica per matematica, logica e risoluzione dei problemi passo dopo passo su hardware che non può ospitare il modello DeepSeek-R1 completo.

deepseek-ai/DeepSeek-R1-Distill-Qwen-14B · Hugging Face

Il compromesso riguarda l'efficienza dell'output. Le tracce di ragionamento possono essere lunghe, aumentando il tempo necessario per ottenere una risposta e il consumo energetico. Imposta un limite ragionevole di token e riservalo ai problemi che traggono vantaggio da un ragionamento ponderato, invece che alle conversazioni di routine.

  • Sceglilo se: vuoi un ragionamento locale conveniente, con quantizzazioni ampiamente disponibili.
  • Evitalo se: dai più valore a risposte concise e immediate che alla profondità del ragionamento.
  • Punto ideale: 12–16 GB di VRAM o 24–32 GB di RAM di sistema.

7. Qwen3-VL-8B Instruct — Il migliore per immagini e comprensione dei documenti

Qwen3-VL-8B Instruct è una scelta mirata per immagini di schermate, pagine scansionate, diagrammi, grafici e risposte a domande visive. Le build GGUF ufficiali includono pesi Q4_K_M e file separati per la proiezione visiva, facilitando la distribuzione tramite strumenti compatibili con llama.cpp.

Qwen/Qwen3-VL-8B-Instruct · Hugging Face

Il suo effettivo utilizzo della memoria dipende dal numero e dalla risoluzione delle immagini, quindi lascia più margine di quanto faresti per un modello da 8B solo testuale. Per gli archivi privati, combina il modello con OCR e recupero delle informazioni invece di inserire in un unico prompt ogni pagina alla massima risoluzione. Il nostro confronto dell'hardware per l'IA fotografica e il RAG documentale illustra i diversi colli di bottiglia.

  • Sceglilo se: lavori con immagini, PDF, schermate o documenti visivi.
  • Evitalo se: il tuo carico di lavoro è interamente testuale.
  • Punto ideale: 12 GB di VRAM o 24 GB di memoria di sistema condivisa.

8. Phi-4 Mini Instruct — Ideale per il ragionamento con poca memoria

Phi-4 Mini Instruct è progettato per gli ambienti con risorse computazionali limitate e sensibili alla latenza, con particolare attenzione al rispetto delle istruzioni, alla matematica e alla logica. Microsoft indica una finestra di contesto di 128K, anche se si applica lo stesso avviso relativo alla memoria locale: le capacità del modello non significano che sia opportuno allocare il contesto massimo su una macchina poco potente.

Benvenuti ai nuovi modelli Phi-4: Microsoft Phi-4-mini e Phi-4-multimodal

È un ottimo primo modello per un PC compatto, un laptop datato o un server incentrato sulla CPU. Microsoft fornisce inoltre versioni ONNX ottimizzate per la distribuzione su CPU e GPU in ambienti desktop e mobili.

  • Sceglilo se: ti serve capacità di ragionamento con un ingombro ridotto in memoria.
  • Evitalo se: la capacità di ricordare un'ampia quantità di informazioni fattuali e la scrittura creativa sono le tue priorità principali.
  • Punto ideale: 8–16 GB di RAM di sistema o una GPU da 6 GB.

9. Gemma 3n E4B — Ideale per l'uso multimodale su dispositivi mobili e con risorse limitate

Gemma 3n E4B è stato progettato per funzionare in modo efficiente su dispositivi con risorse limitate, supportando input di testo, immagini, video e audio. È una scelta utile quando una GPU integrata o un laptop con memoria unificata sono più importanti delle massime prestazioni su desktop.

gemma3n:e4b

Verifica la compatibilità del runtime prima di impegnarti in un flusso di lavoro. Il supporto multimodale può richiedere librerie aggiornate e backend specifici della piattaforma, mentre l’accesso al modello può richiedere l’accettazione dei termini di licenza di Google. Una volta supportato, il suo ingombro ridotto lo rende interessante per strumenti da campo privati e per l’analisi offline dei contenuti multimediali.

  • Sceglilo se: vuoi funzioni multimodali su un laptop efficiente o un dispositivo edge.
  • Evitalo se: hai bisogno della configurazione multipiattaforma più semplice.
  • Punto ideale: 16 GB di memoria unificata con un runtime nativo ottimizzato.

10. Llama 3.2 3B Instruct — La scelta leggera migliore per l’ecosistema

Llama 3.2 3B Instruct non è più il modello piccolo più recente, ma resta utile grazie all’ampio supporto di runtime, tutorial e community. Meta ha progettato i modelli testuali da 1B e 3B per il dialogo multilingue, il recupero delle informazioni, la sintesi e l’uso sui dispositivi.

meta-llama/Llama-3.2-3B-Instruct · Hugging Face

Sceglilo per la compatibilità, non per un’intelligenza ai vertici della categoria. Funziona su sistemi modesti ed è facile da integrare, il che lo rende una base affidabile per testare un’applicazione prima di passare a un modello più grande.

  • Sceglilo se: apprezzi strumenti maturi e un download di piccole dimensioni.
  • Evitalo se: vuoi la qualità di output più elevata disponibile nel 2026.
  • Punto ideale: 8 GB di RAM di sistema, con offload parziale opzionale sulla GPU.

Quale modello è adatto al tuo hardware?

8 GB di RAM o 4–6 GB di VRAM

Inizia con Phi-4 Mini o Llama 3.2 3B con quantizzazione a 4 bit. Mantieni il contesto tra 4K e 8K, esegui una richiesta alla volta e considera la generazione sulla CPU utilizzabile, ma non istantanea. I sistemi più piccoli funzionano bene per classificazione, riepiloghi, RAG semplice e automazioni domestiche.

16 GB di RAM o 8–12 GB di VRAM

Qwen3.5-9B è la raccomandazione predefinita. Anche Qwen3-VL-8B è adatto quando è richiesto l’input visivo, sebbene necessiti di un margine maggiore. Questa fascia offre il miglior equilibrio per i PC da gaming più diffusi, i MacBook e le configurazioni compatte per l’IA locale.

24–32 GB di RAM o 16 GB di VRAM

Gemma 4 12B, Ministral 3 14B, DeepSeek-R1-Distill-Qwen-14B e gpt-oss-20b diventano opzioni realistiche. La fascia GPU da 16 GB è particolarmente utile perché evita i lenti trasferimenti dalla CPU alla GPU, mantenendo al contempo una capacità sufficiente per un contesto moderato.

64 GB di RAM o 24 GB di VRAM

Qwen3-Coder-30B-A3B è una scelta pratica in questo caso, insieme a versioni quantizzate di qualità superiore di modelli più piccoli. Questa fascia è adatta ad assistenti di programmazione seri, più servizi locali, raccolte RAG più ampie e sperimentazioni con contesti più lunghi.

Se le prestazioni deludono, individua il vero collo di bottiglia prima di sostituire il modello. La nostra guida ai colli di bottiglia di calcolo, memoria, archiviazione e rete nell’IA locale aiuta a distinguere la generazione lenta dei token dal caricamento lento del modello o dal recupero lento.

Come eseguire questi modelli in locale

  1. Scegli un runtime. Ollama è comodo per l’uso da riga di comando e tramite API, LM Studio offre un’interfaccia desktop intuitiva e llama.cpp garantisce un controllo esteso sull’inferenza GGUF e sullo scaricamento dei calcoli sull’hardware.
  2. Scarica una build quantizzata. Q4_K_M è un punto di partenza ragionevole in generale per i modelli GGUF. I formati con meno bit fanno risparmiare memoria, ma possono ridurre la qualità; quelli con più bit migliorano la fedeltà, ma consumano più RAM.
  3. Inizia con un contesto breve. Imposta prima 4K–8K, osserva memoria e velocità, quindi aumenta gradualmente. Pubblicizzare un contesto da 128K o 256K non significa che il contesto massimo sia gratuito.
  4. Scarica alcuni livelli sulla GPU. Se il modello completo non entra nella VRAM, lo scaricamento parziale può comunque accelerare l’inferenza, mentre la RAM di sistema contiene il resto.
  5. Prova i tuoi prompt. Valuta accuratezza, latenza, chiamate agli strumenti, formattazione e allucinazioni nelle attività che esegui davvero. I benchmark pubblici non possono riprodurre i tuoi documenti o il tuo flusso di lavoro.

Per un piano di implementazione completo, segui la guida di ZimaSpace alla configurazione di un server IA locale. Se la privacy dei dati è il motivo principale per cui scegli una soluzione locale, la guida alla privacy degli LLM locali self-hosted tratta archiviazione, esposizione della rete, registri e controlli degli accessi.

Dove si colloca l’hardware Zima

Un sistema di IA locale non deve necessariamente concentrare archiviazione, orchestrazione e inferenza su un unico dispositivo. Un ZimaBoard 2 può coordinare API dei modelli, RAG leggero, automazioni e servizi per dati privati. Il suo processore Intel N150, fino a 16 GB di memoria LPDDR5, doppia porta 2.5GbE, SATA ed espansione PCIe lo rendono più adatto a piccoli modelli eseguiti sulla CPU o all’orchestrazione che all’inferenza di LLM di fascia alta.

Per dataset più grandi e hardware IA espandibile, ZimaCube 2 combina archiviazione su più unità, espansione SSD, Thunderbolt 4 e opzioni PCIe. Può ospitare localmente i file dei modelli e i dati RAG mentre un sistema dotato di GPU gestisce l'inferenza, oppure fungere da centro di un homelab IA più integrato. Questa separazione mantiene i dati importanti in locale senza costringere ogni servizio a utilizzare la macchina con il maggiore consumo energetico.

Domande frequenti

Qual è il miglior modello di IA da eseguire localmente nel 2026?

Qwen3.5-9B è il miglior punto di partenza generale per la maggior parte degli utenti perché bilancia capacità, velocità, prestazioni multilingue e un ingombro gestibile dopo la quantizzazione. Scegli Gemma 4 12B per il lavoro multimodale, gpt-oss-20b per un ragionamento più avanzato o Qwen3-Coder-30B-A3B per la programmazione seria.

Posso eseguire un modello di IA locale senza una GPU?

Sì. L'inferenza su CPU funziona bene con modelli più piccoli da 3B–4B e può eseguire modelli da 8B–9B se hai abbastanza RAM, ma la generazione sarà più lenta. Apple Silicon e le GPU integrate moderne possono usare memoria condivisa, mentre i sistemi x86 spesso traggono vantaggio dall'offload parziale sulla GPU.

Quanta RAM mi serve per un LLM locale?

Otto gigabyte sono sufficienti per i modelli quantizzati compatti, 16 GB sono il minimo pratico per la maggior parte degli utenti e 32 GB permettono di utilizzare modelli da 12B–20B con un margine utile. Per pesi quantizzati della classe 30B, 32 GB possono bastare per eseguire il modello, ma 64 GB sono più comodi quando sono coinvolti altri servizi e contesti lunghi.

Un modello a 4 bit perde qualità?

Di solito solo leggermente, ma le buone quantizzazioni a 4 bit preservano una qualità sufficiente per chat, RAG, assistenza alla programmazione e uso domestico, riducendo notevolmente il consumo di memoria. L'impatto esatto dipende dal modello e dal metodo di quantizzazione, quindi confronta alcuni prompt rappresentativi prima di standardizzare la tua distribuzione.

La VRAM è più importante della RAM di sistema?

La VRAM determina solitamente quanta parte del modello può funzionare alla massima velocità della GPU. La RAM di sistema può contenere i pesi che non entrano nella VRAM, ma lo spostamento dei dati tra CPU e GPU riduce le prestazioni. I sistemi a memoria unificata rendono meno netta questa distinzione, anche se la larghezza di banda della memoria rimane importante.

Verdetto finale

Inizia con il modello più piccolo che completa in modo affidabile il tuo carico di lavoro reale. Per la maggior parte delle persone questo significa Qwen3.5-9B; passa a Gemma 4 12B per gli input multimodali, a gpt-oss-20b o DeepSeek-R1-Distill-Qwen-14B per il ragionamento e a Qwen3-Coder-30B-A3B per la programmazione. Adatta la quantizzazione e la lunghezza del contesto alla memoria disponibile, quindi potenzia l'hardware solo dopo aver misurato il collo di bottiglia.

Hub Tecnologico e AI

Altro da leggere

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.