Qwen3.5-9B es el mejor modelo de IA local versátil para la mayoría de los PC de consumo en 2026.
La mejor opción también puede cambiar según tu flujo de trabajo: los modelos compactos son más rápidos en CPU y portátiles, los modelos de 8B–14B suelen ofrecer el mejor equilibrio entre calidad y memoria, y los modelos más grandes o de mezcla de expertos tienen sentido cuando la precisión en programación, razonamiento o tareas multimodales importa más que la velocidad.
La comparativa siguiente utiliza implementaciones prácticas de 4 bits como referencia, para que puedas asociar un modelo con la RAM o VRAM que ya tienes antes de descargar decenas de gigabytes de pesos.
Comparativa de modelos de IA local: la selección final
| Puesto | Modelo | Ideal para | Tamaño aproximado en 4 bits | Hardware práctico para empezar | Principal desventaja |
|---|---|---|---|---|---|
| 1 | Qwen3.5-9B | El mejor en general | 6–8 GB | 16 GB de RAM o 8–12 GB de VRAM | Los contextos largos necesitan mucha más memoria |
| 2 | Gemma 4 12B | Trabajo multimodal | 9–12 GB | 24 GB de RAM o 12–16 GB de VRAM | Más pesado que los modelos que solo trabajan con texto |
| 3 | gpt-oss-20b | Razonamiento local | Aproximadamente 16 GB en MXFP4 | 16 GB de memoria unificada o VRAM | Necesita hardware de consumo de gama alta |
| 4 | Ministral 3 14B Instruct | Agentes y uso de herramientas | 9–12 GB | 24 GB de RAM o 12–16 GB de VRAM | Más lento que los modelos 8B–9B más pequeños |
| 5 | Qwen3-Coder-30B-A3B | Programación local | 18–22 GB | 32 GB de RAM o 24 GB de VRAM | El peso total sigue siendo grande a pesar de que hay 3.3B de parámetros activos |
| 6 | DeepSeek-R1-Distill-Qwen-14B | Razonamiento económico | 9–11 GB | 24 GB de RAM o 12–16 GB de VRAM | Los resultados del razonamiento pueden ser prolijos y lentos |
| 7 | Qwen3-VL-8B Instruct | Imágenes y documentos | 7–10 GB, incluidos los componentes de visión | 16–24 GB de RAM o 12 GB de VRAM | La resolución de las imágenes afecta al uso de memoria |
| 8 | Phi-4 Mini Instruct | Razonamiento en dispositivos pequeños | 3–5 GB | 8–16 GB de RAM o 6 GB de VRAM | Conocimientos menos amplios que los de los modelos más grandes |
| 9 | Gemma 3n E4B | IA multimodal para móviles y dispositivos con pocos recursos | 4–7 GB | 8–16 GB de RAM unificada | La compatibilidad con entornos de ejecución varía según la plataforma |
| 10 | Llama 3.2 3B Instruct | Compatibilidad amplia con el ecosistema | 2–4 GB | 8 GB de RAM o 4–6 GB de VRAM | Más antiguo y menos capaz que los modelos pequeños más recientes |
Las cifras de memoria son estimaciones para la planificación, no garantías. Suponen una versión práctica de 4 bits cuando está disponible y una ventana de contexto moderada. La sobrecarga del entorno de ejecución, la caché KV, los codificadores de visión, el tamaño del lote y la descarga a la GPU pueden añadir varios gigabytes.
Cómo elegimos los mejores modelos para uso local
Esto no es una clasificación basada únicamente en benchmarks. Un modelo que gana una prueba, pero no cabe en tu equipo, no es el mejor modelo local para ti. Priorizamos cinco factores: calidad útil de los resultados, compatibilidad realista con hardware de consumo, disponibilidad de entornos de ejecución locales o versiones cuantizadas, cobertura de tareas y las dificultades relacionadas con las licencias o el acceso.
También tratamos el «hardware de consumo» de forma amplia: PC con Windows y Linux, Mac con Apple Silicon, servidores domésticos compactos y homelabs centrados en NAS. Si primero vas a elegir los componentes, utiliza nuestra guía de hardware económico para servidores de IA local para dimensionar el sistema completo en lugar de centrarte únicamente en la memoria de la GPU.
1. Qwen3.5-9B — El mejor modelo de IA local en general
Qwen3.5-9B es la recomendación más equilibrada para un equipo moderno con 16 GB o una GPU de 8–12 GB. Es lo bastante pequeño para ejecutarse en un formato cuantizado práctico y, a la vez, lo bastante capaz para chats, resúmenes, generación aumentada por recuperación, tareas multilingües y programación ligera.

La tarjeta oficial del modelo indica una ventana de contexto nativa de 262.144 tokens, pero esa cifra no debería convertirse en tu configuración local predeterminada. La caché KV crece con el contexto, así que comienza alrededor de 8K–16K y aumenta solo cuando la carga de trabajo lo justifique. Así mantendrás bajo control la latencia y el uso de memoria.
- Elígelo si: quieres un modelo de propósito general para el uso local diario.
- Evítalo si: tu tarea principal es la generación de código avanzada o la comprensión de audio y vídeo.
- Punto óptimo: cuantización de 4 bits en una GPU de 12 GB, o inferencia híbrida entre CPU y GPU con entre 16 y 24 GB de RAM del sistema.
2. Gemma 4 12B — La mejor para IA multimodal local
Gemma 4 12B es la mejor opción cuando la “IA local” significa algo más que texto. La tarjeta del modelo de Google describe entradas nativas de texto, imagen, audio y vídeo, una ventana de contexto de hasta 256K, compatibilidad multilingüe con más de 140 idiomas y una arquitectura pensada para una ejecución local optimizada.
Esa versatilidad añade carga. Prevé 24 GB de RAM del sistema o entre 12 y 16 GB de VRAM para una implementación cuantizada cómoda, y deja margen adicional para las entradas multimedia. Es especialmente útil para el análisis privado de fotos, la comprensión de documentos, los flujos de trabajo con contenido multimedia de reuniones y la búsqueda multimodal.
- Elígelo si: necesitas un modelo que entienda texto y contenido multimedia.
- Evítalo si: solo necesitas chats de texto rápidos en un portátil con 8 GB.
- Punto óptimo: 16 GB de VRAM o 32 GB de memoria unificada.
3. gpt-oss-20b — El mejor para razonamiento de alta calidad en una GPU de consumo
gpt-oss-20b está dirigido a la gama alta del hardware de consumo. OpenAI afirma que puede ejecutarse con 16 GB de memoria, mientras que su guía oficial de Ollama recomienda al menos 16 GB de VRAM o memoria unificada para el modelo más pequeño.
Es una excelente opción para quienes buscan un razonamiento deliberado, salidas estructuradas o experimentación local sin pasar a GPU de nivel profesional. El inconveniente práctico es que 16 GB son un punto de partida, no un margen holgado: los contextos largos, las solicitudes paralelas o los formatos que no sean MXFP4 pueden aumentar el consumo de memoria.
- Elígelo si: la calidad del razonamiento importa más que la baja latencia.
- Evítalo si: solo tienes 8 GB de VRAM o dependes de la inferencia exclusivamente con CPU.
- Punto ideal: una GPU de 16–24 GB o un sistema Apple Silicon con al menos 24 GB de memoria unificada.
4. Ministral 3 14B Instruct — El mejor para agentes locales y uso de herramientas
Ministral 3 14B Instruct combina texto y visión con llamadas a funciones nativas, salida JSON, compatibilidad multilingüe y una sólida adhesión a las instrucciones del sistema. Mistral presenta la familia para implementaciones en el borde y señala que el modelo de 14B cabe en 24 GB de VRAM en FP8, con requisitos inferiores tras una cuantización adicional.
Para un asistente doméstico privado que utilice herramientas de búsqueda, automatización o archivos, esas funciones de fiabilidad pueden importar más que una pequeña ventaja en las pruebas de referencia. Una versión de 4 bits debería funcionar en hardware con poca memoria, pero entre 12 y 16 GB de VRAM ofrecen un margen de funcionamiento más cómodo.
- Elígelo si: estás creando agentes que usan herramientas o flujos de trabajo estructurados.
- Evítalo si: tu prioridad es obtener el máximo de tokens por segundo en una GPU básica.
- Punto ideal: 16 GB de VRAM y una ventana de contexto moderada.
5. Qwen3-Coder-30B-A3B Instruct — El mejor modelo de programación local
Qwen3-Coder-30B-A3B Instruct está diseñado específicamente para la programación con agentes, la comprensión de repositorios a gran escala y las llamadas a funciones. Su arquitectura de mezcla de expertos contiene 30,5 mil millones de parámetros en total, pero activa aproximadamente 3,3 mil millones por token, lo que mejora la eficiencia computacional sin eliminar la necesidad de almacenar todos los pesos cuantizados.
Esa distinción es importante al planificar el hardware. Por lo general, una compilación de 4 bits debe ejecutarse en una GPU de 24 GB o en una máquina con al menos 32 GB de memoria del sistema. El contexto nativo de 256K resulta atractivo para repositorios grandes, pero los usuarios locales deberían empezar con un tamaño menor, porque el contexto de código puede consumir rápidamente la memoria de la caché KV.
- Elígelo si: la programación es la carga de trabajo principal y tienes 24 GB de memoria gráfica.
- Evítalo si: quieres un asistente ligero para el uso diario.
- Punto ideal: 24 GB de VRAM, almacenamiento NVMe rápido y 64 GB de RAM del sistema para disponer de margen.
6. DeepSeek-R1-Distill-Qwen-14B — Mejor modelo de razonamiento económico
DeepSeek-R1-Distill-Qwen-14B comprime patrones de razonamiento aprendidos de DeepSeek-R1 en un modelo denso de 14B basado en Qwen2.5. Sigue siendo una opción práctica para matemáticas, lógica y resolución de problemas paso a paso en hardware que no puede alojar el modelo DeepSeek-R1 completo.
La contrapartida es la eficiencia de salida. Las trazas de razonamiento pueden ser largas, lo que aumenta el tiempo de respuesta y el consumo de energía. Usa un límite de tokens razonable y resérvalo para problemas que se beneficien de un razonamiento deliberado, en lugar de para conversaciones rutinarias.
- Elígelo si: quieres razonamiento local asequible con cuantizaciones ampliamente disponibles.
- Evítalo si: valoras más las respuestas concisas e instantáneas que la profundidad del razonamiento.
- Punto ideal: 12–16 GB de VRAM o 24–32 GB de RAM del sistema.
7. Qwen3-VL-8B Instruct — Mejor para imágenes y comprensión de documentos
Qwen3-VL-8B Instruct es una opción especializada de visión y lenguaje para capturas de pantalla, páginas escaneadas, diagramas, gráficos y respuestas a preguntas visuales. Las compilaciones GGUF oficiales incluyen pesos Q4_K_M y archivos independientes de proyección visual, lo que facilita su implementación mediante herramientas compatibles con llama.cpp.
Su consumo real de memoria depende del número y la resolución de las imágenes, así que deja más margen del que dejarías para un modelo de texto de 8B. Para archivos privados, combina el modelo con OCR y recuperación de información en lugar de enviar cada página a resolución completa en una sola instrucción. Nuestra comparativa de hardware para IA fotográfica y RAG de documentos explica los distintos cuellos de botella.
- Elígelo si: trabajas con imágenes, archivos PDF, capturas de pantalla o registros visuales.
- Evítalo si: tu carga de trabajo es exclusivamente de texto.
- Punto óptimo: 12 GB de VRAM o 24 GB de memoria compartida del sistema.
8. Phi-4 Mini Instruct — Ideal para el razonamiento con poca memoria
Phi-4 Mini Instruct está diseñado para entornos con recursos informáticos limitados y sensibles a la latencia, con énfasis en el seguimiento de instrucciones, las matemáticas y la lógica. Microsoft indica una ventana de contexto de 128K, aunque se aplica la misma advertencia sobre la memoria local: la capacidad no significa que debas asignar el contexto máximo en una máquina pequeña.
Es un primer modelo inteligente para un PC compacto, un portátil antiguo o un servidor centrado en la CPU. Microsoft también ofrece versiones ONNX optimizadas para implementaciones en CPU y GPU en entornos de escritorio y móviles.
- Elígelo si: necesitas capacidad de razonamiento con un consumo de memoria reducido.
- Evítalo si: tus principales prioridades son una amplia recuperación de datos objetivos y la escritura creativa.
- Punto óptimo: 8–16 GB de RAM del sistema o una GPU de 6 GB.
9. Gemma 3n E4B — Ideal para uso multimodal móvil y con recursos limitados
Gemma 3n E4B fue diseñado para funcionar de manera eficiente en dispositivos con recursos limitados y admitir entradas de texto, imágenes, vídeo y audio. Es una opción útil cuando una GPU integrada o un portátil con memoria unificada son más importantes que el máximo rendimiento de escritorio.
Comprueba la compatibilidad del runtime antes de comprometerte con un flujo de trabajo. La compatibilidad multimodal puede requerir bibliotecas actualizadas y backends específicos de la plataforma, mientras que el acceso al modelo puede exigir aceptar las condiciones de licencia de Google. Una vez compatible, su tamaño compacto lo hace atractivo para herramientas de campo privadas y análisis multimedia sin conexión.
- Elígelo si: quieres funciones multimodales en un portátil eficiente o un dispositivo periférico.
- Evítalo si: necesitas la configuración multiplataforma más sencilla.
- Punto óptimo: 16 GB de memoria unificada con un runtime nativo optimizado.
10. Llama 3.2 3B Instruct — La mejor opción de ecosistema ligero
Llama 3.2 3B Instruct ya no es el modelo pequeño más reciente, pero sigue siendo útil gracias a su amplia compatibilidad con runtimes, tutoriales y la comunidad. Meta diseñó los modelos de texto de 1B y 3B para diálogos multilingües, recuperación de información, resúmenes y uso en dispositivos.
Elígelo por su compatibilidad, no por una inteligencia líder en su categoría. Funciona en sistemas modestos y es fácil de integrar, por lo que constituye una base fiable para probar una aplicación antes de pasar a un modelo más grande.
- Elígelo si: valoras herramientas maduras y una descarga pequeña.
- Evítalo si: quieres la mayor calidad de salida disponible en 2026.
- Punto óptimo: 8 GB de RAM del sistema, con descarga parcial opcional a la GPU.
¿Qué modelo se adapta a tu hardware?
8 GB de RAM o 4–6 GB de VRAM
Empieza con Phi-4 Mini o Llama 3.2 3B con cuantización de 4 bits. Mantén el contexto entre 4K y 8K, ejecuta una solicitud a la vez y espera que la generación en la CPU sea utilizable, aunque no instantánea. Los sistemas pequeños funcionan bien para clasificación, resúmenes, RAG sencillo y automatizaciones domésticas.
16 GB de RAM o 8–12 GB de VRAM
Qwen3.5-9B es la recomendación predeterminada. Qwen3-VL-8B también encaja cuando se requiere entrada visual, aunque necesita más margen. Este nivel ofrece el mejor equilibrio para PC gaming convencionales, MacBooks y configuraciones compactas de IA local.
24–32 GB de RAM o 16 GB de VRAM
Gemma 4 12B, Ministral 3 14B, DeepSeek-R1-Distill-Qwen-14B y gpt-oss-20b se vuelven opciones realistas. El nivel de GPU de 16 GB resulta especialmente útil porque evita las lentas transferencias de la CPU a la GPU, al tiempo que conserva suficiente capacidad para un contexto moderado.
64 GB de RAM o 24 GB de VRAM
Qwen3-Coder-30B-A3B resulta práctico aquí, al igual que las cuantizaciones de mayor calidad de modelos más pequeños. Este nivel es adecuado para asistentes de programación serios, varios servicios locales, colecciones RAG más grandes y la experimentación con contextos más extensos.
Si el rendimiento decepciona, identifica el cuello de botella real antes de sustituir el modelo. Nuestra guía sobre los cuellos de botella de cómputo, memoria, almacenamiento y red en la IA local ayuda a distinguir entre una generación lenta de tokens y una carga lenta del modelo o de la recuperación.
Cómo ejecutar estos modelos de forma local
- Elige un entorno de ejecución. Ollama es práctico para usar desde la línea de comandos y mediante API, LM Studio ofrece una interfaz de escritorio sencilla y llama.cpp proporciona un amplio control sobre la inferencia GGUF y la descarga de trabajo al hardware.
- Descarga una versión cuantizada. Q4_K_M es un punto de partida general razonable para modelos GGUF. Los formatos con menos bits ahorran memoria, pero pueden reducir la calidad; los formatos con más bits mejoran la fidelidad, pero consumen más RAM.
- Empieza con un contexto corto. Configura primero entre 4K y 8K, observa la memoria y la velocidad, y después aumenta gradualmente. Anunciar un contexto de 128K o 256K no hace que el contexto máximo sea gratuito.
- Descarga capas a la GPU. Si el modelo completo no cabe en la VRAM, la descarga parcial aún puede acelerar la inferencia mientras la RAM del sistema almacena el resto.
- Prueba tus propios prompts. Evalúa la precisión, la latencia, las llamadas a herramientas, el formato y las alucinaciones en las tareas que realmente ejecutas. Los benchmarks públicos no pueden reproducir tus documentos ni tu flujo de trabajo.
Para obtener un plan de implementación de extremo a extremo, consulta la guía de ZimaSpace para crear un servidor de IA local. Si la privacidad de los datos es el principal motivo para trabajar de forma local, la guía de privacidad para LLM locales autoalojados aborda el almacenamiento, la exposición de la red, los registros y los controles de acceso.
Dónde encaja el hardware de Zima
Un sistema de IA local no tiene que concentrar el almacenamiento, la orquestación y la inferencia en un solo equipo. Un ZimaBoard 2 puede coordinar API de modelos, RAG ligero, automatizaciones y servicios de datos privados. Su procesador Intel N150, hasta 16 GB de memoria LPDDR5, doble conexión de 2,5 GbE, SATA y expansión PCIe lo hacen más adecuado para modelos pequeños basados en CPU o para la orquestación que para la inferencia de LLM de gama alta.
Para conjuntos de datos más grandes y hardware de IA ampliable, ZimaCube 2 combina almacenamiento con varias unidades, ampliación mediante SSD, Thunderbolt 4 y opciones PCIe. Puede alojar archivos de modelos privados y datos RAG mientras un sistema equipado con GPU se encarga de la inferencia, o servir como centro de un laboratorio doméstico de IA más integrado. Esta separación mantiene los datos valiosos en local sin obligar a todos los servicios a ejecutarse en la máquina que más energía consume.
Preguntas frecuentes
¿Cuál es el mejor modelo de IA para ejecutar localmente en 2026?
Qwen3.5-9B es el mejor punto de partida general para la mayoría de los usuarios porque equilibra capacidad, velocidad, rendimiento multilingüe y un tamaño cuantizado manejable. Elige Gemma 4 12B para trabajos multimodales, gpt-oss-20b para un razonamiento más sólido o Qwen3-Coder-30B-A3B para programación avanzada.
¿Puedo ejecutar un modelo de IA local sin una GPU?
Sí. La inferencia en la CPU funciona bien con modelos pequeños de 3B–4B y puede ejecutar modelos de 8B–9B si tienes suficiente RAM, aunque la generación será más lenta. Apple Silicon y las GPU integradas modernas pueden usar memoria compartida, mientras que los sistemas x86 suelen beneficiarse de la descarga parcial en la GPU.
¿Cuánta RAM necesito para un LLM local?
Ocho gigabytes son suficientes para modelos cuantizados compactos, 16 GB es el mínimo práctico para la mayoría de los usuarios y 32 GB permite usar modelos de 12B–20B con un margen útil. Para pesos cuantizados de la clase de 30B, 32 GB pueden bastar para ejecutar el modelo, pero 64 GB ofrecen mayor comodidad cuando intervienen otros servicios y contextos largos.
¿Un modelo de 4 bits pierde calidad?
Por lo general, un poco, pero las buenas cuantizaciones de 4 bits conservan suficiente calidad para chat, RAG, asistencia para programar y uso doméstico, al tiempo que reducen considerablemente el consumo de memoria. El impacto exacto depende del modelo y del método de cuantización, así que compara varias indicaciones representativas antes de estandarizar tu implementación.
¿Es más importante la VRAM que la RAM del sistema?
La VRAM suele determinar qué parte del modelo puede ejecutarse a la velocidad máxima de la GPU. La RAM del sistema puede almacenar los pesos que no caben, pero mover datos entre la CPU y la GPU reduce el rendimiento. Los sistemas con memoria unificada difuminan esa frontera, aunque el ancho de banda de la memoria sigue siendo importante.
Veredicto final
Comienza con el modelo más pequeño que complete de forma fiable tu carga de trabajo real. Para la mayoría, eso significa Qwen3.5-9B; pasa a Gemma 4 12B para entradas multimodales, a gpt-oss-20b o DeepSeek-R1-Distill-Qwen-14B para el razonamiento, y a Qwen3-Coder-30B-A3B para programar. Adapta la cuantización y la longitud de contexto a la memoria disponible y aumenta el hardware solo después de medir el cuello de botella.
Centro de Tecnología e IA
Más para leer

Los 10 mejores frameworks de agentes de IA que vale la pena probar en 2026
Compara los mejores frameworks de agentes de IA en 2026, incluidos LangGraph, OpenAI Agents SDK, CrewAI, Google ADK, LlamaIndex, Mastra y más.

Por qué el rendimiento de Jellyfin difiere entre las conexiones LAN y remotas
El servidor puede ser idéntico, pero el acceso remoto cambia el presupuesto de red y a menudo lleva a tomar una decisión diferente sobre...

¿Jellyfin funciona de forma fiable detrás de CGNAT o doble NAT?
El servidor multimedia sigue funcionando; el problema sin resolver es crear una ruta accesible y segura a través de la traducción de direcciones, con...

