Xiaomi AI Cube ejecuta un modelo de 120B localmente: ¿es este el futuro del ordenador personal con IA?

Lauren Pan es el fundador de ZimaSpace y el arquitecto detrás de la aclamada serie ZimaBoard. Combinando diseño industrial con ingeniería embebida, Lauren lanzó ZimaSpace con una misión clara: democratizar la computación en la nube personal. Él opera bajo la creencia de que el hardware debe ser tanto "hackeable" como hermoso—cerrando la brecha entre servidores de grado industrial y dispositivos de consumo. Hoy, lidera el equipo de ingeniería en la creación de herramientas que brindan a los creadores control total sobre sus vidas digitales.

Xiaomi AI Cube es un ordenador de escritorio con IA en fase de prototipo, basado en una idea inusual: integrar suficiente memoria y capacidad de cálculo local especializada en una caja de 150 W para mantener disponibles localmente tanto un modelo 120B como otro mucho más pequeño de 3B. Xiaomi ha confirmado 80 GB de memoria unificada, tres procesadores XRING —O3, O100 y D100— y un cambio rápido/lento de modelo para cargas de trabajo que incluyen desarrollo front-end y programación compleja.

Pero «ejecuta 120B localmente» es una afirmación sobre capacidad, no un punto de referencia completo de rendimiento. Xiaomi no ha publicado la topología completa de memoria del Cube, la cuantización del modelo 120B, el contexto utilizable, la velocidad de generación, la compatibilidad de software, el precio ni la fecha de lanzamiento comercial. Por ahora, AI Cube resulta más útil como adelanto de una nueva arquitectura de ordenador personal con IA que como producto terminado que los compradores puedan evaluar.

¿Qué es Xiaomi AI Cube?

Xiaomi AI Cube es un prototipo de ingeniería que combina tres procesadores XRING propios con 80 GB de memoria unificada para la inferencia local de modelos grandes.

Detalles del AI Cube Lo que Xiaomi ha confirmado
Estado Prototipo de ingeniería
Procesadores XRING O3 + O100 + D100
Memoria Memoria unificada de 80 GB
Modelos locales Modelo 120B + modelo 3B
Comportamiento del modelo Cambio rápido/lento de modelo
Rendimiento sostenido Hasta 150 W
Cargas de trabajo demostradas Desarrollo front-end y programación compleja
Precio No anunciado
Fecha de lanzamiento No anunciado

La descripción pública de Xiaomi puede consultarse en la publicación oficial sobre el prototipo AI Cube.

La cifra de 120B llama la atención, pero la pregunta más útil es qué se necesita para hacer práctico en un escritorio un modelo de ese tamaño.

¿Por qué es tan importante ejecutar localmente un modelo de 120B?

Un modelo de 120.000 millones de parámetros plantea inmediatamente un problema de memoria.

Con una precisión de 16 bits, solo los pesos sin procesar requerirían aproximadamente:

120B × 2 bytes ≈ 240 GB

Con una precisión de 8 bits, esa cifra se acerca a los 120 GB, mientras que los pesos de 4 bits ocupan aproximadamente 60 GB antes de la sobrecarga de ejecución.

Eso hace plausible una máquina de 80 GB para un modelo de 120B muy cuantizado, pero alojar los pesos es solo una parte de la implementación.

La inferencia también necesita memoria para:

  • metadatos de cuantización,
  • búferes de ejecución,
  • caché KV,
  • tokens de contexto,
  • software del sistema,
  • y potencialmente un estado multimodal.

Adaptar un modelo no es lo mismo que ejecutarlo a una velocidad y con un contexto útiles.

Por esta misma razón, los requisitos prácticos de hardware para IA local dependen del tamaño del modelo, la cuantización, el contexto y la concurrencia, no de una única cifra sencilla de RAM.

¿Puede una memoria unificada de 80 GB ejecutar realmente un modelo 120B?

Sí, un modelo 120B cuantizado puede caber razonablemente en un presupuesto de memoria de 80 GB, pero Xiaomi no ha publicado información suficiente para calcular el contexto utilizable real ni el rendimiento del Cube.

Las variables sin respuesta incluyen:

  • la versión exacta del modelo 120B,
  • formato de cuantización,
  • longitud de contexto utilizable,
  • tiempo hasta el primer token,
  • velocidad de generación,
  • y si los modelos 3B y 120B permanecen residentes simultáneamente.

Un modelo que técnicamente se carga, pero genera texto a una velocidad inaceptablemente baja, es muy distinto de un asistente personal con buena capacidad de respuesta. Los contextos largos y varios agentes simultáneos también pueden consumir una cantidad considerable de memoria adicional.

Esa distinción —entre que el modelo quepa y que pueda utilizarse en una implementación— es especialmente importante a medida que los modelos abiertos más grandes llegan al hardware doméstico. Restricciones similares aparecen en las cargas de trabajo de IA local en servidores domésticos actuales, donde simplemente hacer que un modelo quepa no garantiza una buena experiencia permanente.

¿El Xiaomi AI Cube realmente tiene 1,22 TB/s de ancho de banda de memoria?

Xiaomi ha publicado una cifra de ancho de banda de memoria cercana al procesador de 1,22 TB/s para el acelerador XRING O100, pero eso no demuestra que todo el conjunto de memoria de 80 GB del AI Cube funcione a 1,22 TB/s.

Esta distinción se ha convertido en una de las cuestiones técnicas más importantes en torno al prototipo.

El O100 se posiciona como un acelerador de IA de gran ancho de banda que utiliza apilamiento 3D a nivel de oblea. El D100 es un procesador de IA independiente, con gran capacidad de cómputo y compatible con configuraciones de memoria mucho mayores, mientras que el O3 es el SoC de propósito general.

Xiaomi aún no ha publicado un diagrama de bloques de memoria que explique:

  • cómo se distribuye el conjunto de 80 GB,
  • qué chip posee cada memoria,
  • qué parte puede acceder a la ruta de mayor ancho de banda del O100,
  • ancho de banda entre chips,
  • dónde residen los pesos del modelo 120B,
  • o dónde se mantiene la caché KV.

Las especificaciones del procesador disponible se resumen en Especificaciones de lanzamiento de Xiaomi XRING.

Los usuarios de IA local notaron la misma ambigüedad casi de inmediato. Una amplia discusión de AI Cube en LocalLLaMA se centró especialmente en cómo el ancho de banda de O100 se relaciona con D100 y con el conjunto de memoria más grande del Cube.

Hasta que Xiaomi publique la topología, la interpretación más segura es sencilla: 1.22TB/s es una especificación de O100, no una cifra de ancho de banda confirmada para cada byte de los 80GB de memoria de AI Cube.

¿Por qué es importante el ancho de banda de memoria para la IA local?

La inferencia de modelos grandes mueve repetidamente los datos del modelo por la memoria mientras genera tokens. Eso significa que la aritmética del acelerador es solo una parte del rendimiento.

Un dispositivo puede anunciar una cantidad enorme de TOPS y, aun así, seguir esperando a que los datos lleguen a sus unidades de cómputo. Por tanto, la decodificación token por token puede depender mucho del ancho de banda de memoria.

Por eso la arquitectura de O100 resulta interesante, aunque su proceso de 6 nm parezca menos avanzado que el de los chips más recientes de Xiaomi. Su diseño está orientado a cargas de trabajo de IA de alto ancho de banda y memoria cercana, en lugar de limitarse a maximizar la capacidad de cómputo anunciada.

En el caso de los LLM locales, el ancho de banda de memoria a veces puede revelar más sobre la inferencia práctica que una cifra enorme de TOPS.

Pero el rendimiento real de 120B del Cube seguirá siendo desconocido hasta que Xiaomi publique benchmarks a nivel de sistema, en lugar de especificaciones de chips individuales.

¿Por qué ejecutar un modelo 3B si Xiaomi AI Cube puede ejecutar uno de 120B?

El modelo pequeño 3B podría revelar más sobre la arquitectura de AI Cube que el modelo 120B, presentado como característica principal.

Usar el modelo más grande disponible para cada solicitud desperdiciaría latencia, ancho de banda de memoria y energía en tareas que no requieren un razonamiento de nivel frontera.

Un modelo pequeño puede encargarse potencialmente de cargas de trabajo rutinarias como:

  • detección de intenciones,
  • clasificación,
  • enrutamiento,
  • transformaciones breves,
  • extracción de metadatos,
  • etiquetado de archivos,
  • y tareas ligeras en segundo plano.

El modelo más grande puede reservarse para tareas más exigentes, como programación compleja, planificación, razonamiento difícil y síntesis extensa.

Eso crea una arquitectura útil:

modelo local pequeño para la carga base, modelo local más grande para la escalada.

Xiaomi ha confirmado el cambio rápido/lento, pero no ha publicado la política de enrutamiento real. Por lo tanto, afirmar que tareas específicas ya están asignadas al modelo 3B o al 120B sería especulativo.

La idea general ya es relevante para las cargas de trabajo de IA locales y de frontera modernas: el modelo más potente no tiene que ser el predeterminado para cada solicitud.

¿Por qué Xiaomi AI Cube necesita tres chips de IA diferentes?

Una estación de trabajo de IA local convencional suele combinar una CPU de propósito general con RAM del sistema y una o más GPU discretas.

AI Cube combina, en cambio, tres procesadores con funciones públicas diferentes.

Chip XRING Posicionamiento público
O3 SoC insignia de propósito general con CPU, GPU y NPU
O100 Acelerador de IA de gran ancho de banda centrado en el cómputo cercano a la memoria
D100 Procesador de IA de alto rendimiento con compatibilidad con configuraciones de gran capacidad de memoria

Esto apunta hacia un cómputo heterogéneo de IA local: distintos chips para distintas características de las cargas de trabajo, en lugar de pedirle a una única GPU grande que lo haga todo.

Sin embargo, Xiaomi no ha publicado un mapa de ejecución detallado chip por chip. Aún no sabemos si O3 ejecuta el modelo pequeño, si O100 gestiona una etapa de inferencia concreta o si D100 se encarga de la ejecución del modelo más grande.

Son hipótesis de ingeniería razonables, no detalles de implementación confirmados.

¿Está Xiaomi AI Cube intentando convertirse en una alternativa a DGX Spark?

Desde el punto de vista arquitectónico, AI Cube pertenece a la misma categoría emergente que DGX Spark y los sistemas Apple Silicon con gran capacidad de memoria: hardware personal diseñado para mantener modelos de IA inusualmente grandes cerca del usuario.

En la práctica, es prematuro hacer una comparación directa.

Área Xiaomi AI Cube Lo que aún debe demostrarse
Memoria Memoria unificada de 80 GB Topología completa y ancho de banda utilizable
Cómputo O3 + O100 + D100 Rendimiento real de los modelos
Capacidad de modelos Implementación local de 120B + 3B Cuantización, contexto y concurrencia
Software Detalles públicos incompletos Compatibilidad con entornos de ejecución y marcos
Consumo Objetivo sostenido de 150 W Eficiencia de inferencia medida
Precio No anunciado Valor real frente a plataformas maduras

La ventaja de DGX Spark no es simplemente el hardware. NVIDIA aporta CUDA, bibliotecas maduras, entornos de ejecución de inferencia y un ecosistema de desarrolladores consolidado.

Eso hace que la siguiente pregunta sobre AI Cube tenga menos que ver con el silicio y más con el software.

¿Qué software ejecutará realmente Xiaomi AI Cube?

La capacidad del hardware no crea automáticamente una plataforma útil de IA local.

Con el tiempo, los desarrolladores querrán respuestas claras sobre la compatibilidad con:

  • llama.cpp,
  • Ollama,
  • vLLM,
  • PyTorch,
  • entornos de desarrollo de Linux,
  • cargas de trabajo de Docker o contenedores,
  • GGUF y formatos de cuantización comunes,
  • API compatibles con OpenAI,
  • marcos de ajuste fino,
  • y los arneses de agentes actuales.

Xiaomi ha demostrado cargas de trabajo de programación, pero no ha publicado una matriz amplia de compatibilidad de terceros para AI Cube.

Esto es importante porque un acelerador potente con un soporte de entorno de ejecución deficiente puede ser menos útil que un hardware más lento respaldado por kernels maduros, controladores estables, conversión sencilla de modelos y una amplia comunidad de desarrolladores.

Esta preocupación también aparece repetidamente en el debate de LocalLLaMA. Los usuarios no evalúan AI Cube únicamente por sus 80 GB y 120B; se preguntan si XRING puede desarrollar el ecosistema de software necesario para que esas especificaciones resulten útiles.

Un ordenador personal de IA necesita una plataforma de software, no solo un acelerador de IA.

¿Es AI Cube un PC, una estación de trabajo o un servidor de IA siempre activo?

AI Cube puede resultar más interesante como dispositivo personal de cómputo de IA que como PC convencional.

Un PC tradicional es principalmente interactivo: las aplicaciones se ejecutan cuando el usuario las abre. Un nodo personal de IA puede mantener los modelos disponibles de forma continua para:

  • agentes de programación,
  • inferencia en segundo plano,
  • procesamiento de documentos,
  • análisis multimodal privado,
  • API de IA local,
  • flujos de trabajo RAG,
  • y automatización de larga duración.

Esto cambia las prioridades de hardware hacia una memoria persistente, refrigeración sostenida, inferencia predecible, gran ancho de banda y servicios locales estables.

Por eso también los emergentes agentes de IA local-first se parecen cada vez más a cargas de trabajo de infraestructura que a aplicaciones de escritorio convencionales.

Si AI Cube es el nodo de cómputo, ¿dónde viven tus datos de IA?

Un ordenador dedicado a la IA no sustituye automáticamente a un servidor doméstico o NAS, porque la inferencia y los datos persistentes resuelven problemas diferentes.

Un nodo de cómputo de IA está optimizado para:

  • pesos de los modelos,
  • memoria de gran ancho de banda,
  • aceleradores,
  • inferencia de baja latencia,
  • y cargas de trabajo de razonamiento.

La infraestructura local persistente está optimizada para:

  • documentos,
  • fotos y vídeos,
  • repositorios de código,
  • archivos de origen para RAG,
  • bases de datos vectoriales,
  • memoria de agentes,
  • registros,
  • copias de seguridad,
  • y aplicaciones siempre activas.

Esta distinción es importante porque el cómputo de IA cambia más rápido que los datos personales. Los modelos, los aceleradores y los entornos de ejecución pueden reemplazarse cada pocos años; los archivos, el historial de proyectos y el conocimiento privado deberían permanecer estables.

La misma separación aparece al decidir si la IA local y el almacenamiento de archivos deberían compartir una máquina o dividirse entre sistemas especializados.

Un servidor persistente también puede proporcionar los archivos privados, los índices de recuperación y el contexto duradero que utiliza un asistente de IA privado en un NAS sin requerir que el mismo equipo aloje el modelo más grande posible.

AI Cube sugiere que la computación personal con IA podría volverse reemplazable, mientras que los datos personales de IA seguirían siendo persistentes.

¿Qué seguimos sin saber sobre Xiaomi AI Cube?

Pregunta Respuesta actual
¿Puede ejecutar 120B localmente? Xiaomi dice que sí
¿Qué modelo 120B exacto? No está documentado por completo en los detalles públicos del prototipo de Xiaomi
¿Cómo está cuantizado? No divulgado
¿Cuánto contexto se puede utilizar? No divulgado
¿Qué velocidad alcanza el modelo 120B? No divulgado
¿Funcionan los 80 GB completos a 1,22 TB/s? No establecido; 1,22 TB/s es una especificación del O100
¿Cómo se enrutan los modelos 3B y 120B? Cambio entre modos rápido y lento confirmado; política no divulgada
¿Es compatible con Ollama o llama.cpp? No confirmado públicamente
¿Cuánto costará? No anunciado
¿Cuándo se podrá comprar? No se ha anunciado una fecha de lanzamiento comercial

También es importante no combinar las cifras de referencia de la terminal de demostración O100 independiente de Xiaomi con las de AI Cube.

Otro prototipo O3 + O100 demostró un alto rendimiento de tokens con una carga de trabajo MiMo mucho menor. Eso no significa que AI Cube ejecute su modelo 120B a la misma velocidad. La distinción se explica en las demostraciones de prototipos de Xiaomi.

¿Es necesario que Xiaomi AI Cube sea barato para ser relevante?

Como demostración de arquitectura, no. Como nueva categoría de computación personal, absolutamente.

Si el hardware de IA local con mucha memoria alcanza los precios de las estaciones de trabajo de consumo de gama alta, podría hacer que la inferencia local de modelos de clase 100B sea práctica para muchos más desarrolladores.

Si el precio final es varias veces superior, el mismo hardware se convierte en una estación de trabajo especializada en IA en lugar de un ordenador personal con IA para el mercado masivo.

Los usuarios de Reddit ya especulan mucho sobre el precio, pero Xiaomi aún no ha anunciado ninguno. Hasta que exista un producto comercial, las estimaciones de precio deben considerarse especulación.

Por eso las comparativas de costes de la IA local a largo plazo importan más que el precio del hardware por sí solo: el uso, el tamaño del modelo, la electricidad y el aumento de los costes de la nube influyen en si la computación local dedicada resulta económicamente viable.

¿Es Xiaomi AI Cube el futuro del ordenador personal con IA?

Quizá desde el punto de vista arquitectónico, aunque el ordenador personal de IA definitivo no tenga exactamente el mismo aspecto que este prototipo.

Las ideas importantes son:

  • gran memoria compartida dimensionada en torno a los pesos del modelo,
  • aceleración de IA de gran ancho de banda,
  • procesadores heterogéneos,
  • modelos pequeños y grandes disponibles al mismo tiempo,
  • computación sostenida en lugar de una ejecución limitada a ráfagas,
  • ejecución de modelos locales,
  • y servicios de IA que permanezcan disponibles de forma continua.

Eso es más importante que simplemente añadir una NPU a un PC normal y llamarlo un PC con IA.

AI Cube parte de la carga de trabajo del modelo y diseña la máquina a su alrededor.

El prototipo aún plantea importantes cuestiones sin respuesta: rendimiento con 120B, topología de memoria, compatibilidad de software, precio y disponibilidad. Pero la arquitectura apunta hacia un futuro plausible en el que la IA local tenga su propia capa de computación dedicada, mientras que los archivos, la memoria y el estado a largo plazo permanezcan en una infraestructura local persistente.

El ordenador personal de IA quizá no sea un PC que ejecute IA ocasionalmente. Podría ser un nodo de computación local siempre disponible, diseñado para servir varios modelos mientras los datos duraderos del usuario permanecen independientes del acelerador que resulte ser el más rápido este año.

Preguntas frecuentes: Xiaomi AI Cube y los modelos locales de 120B

¿Puede Xiaomi AI Cube ejecutar un modelo de 120B sin recurrir a la nube?

Xiaomi afirma que el prototipo puede ejecutar localmente un modelo de 120B. Sin embargo, la empresa no ha publicado la cuantización exacta, la longitud del contexto ni la configuración del entorno de ejecución utilizados para ello.

¿Cuánta memoria necesita un modelo de 120B?

Los pesos sin procesar de un modelo de 120B requieren aproximadamente 240 GB en FP16, 120 GB a 8 bits y unos 60 GB a 4 bits, antes de contar la sobrecarga del entorno de ejecución. El uso real de memoria también depende de los metadatos de cuantización, la caché KV, la longitud del contexto y el software de inferencia.

¿Es compatible Xiaomi AI Cube con Ollama?

Xiaomi no ha confirmado públicamente la compatibilidad con Ollama. La compatibilidad con Ollama, llama.cpp, vLLM y otros entornos de ejecución de IA local populares sigue siendo una de las principales cuestiones de software sin respuesta.

¿Qué modelo de 120B ejecuta Xiaomi AI Cube?

Informaciones públicas han asociado el prototipo con la familia de modelos MiMo de Xiaomi, pero la descripción pública de AI Cube de Xiaomi no ha proporcionado una especificación completa del modelo, la versión y la cuantización.

¿Se puede comprar Xiaomi AI Cube?

Actualmente, no. AI Cube se ha presentado como un prototipo de ingeniería, y Xiaomi no ha anunciado un precio de venta ni una fecha de envío para este dispositivo concreto.

¿Es Xiaomi AI Cube un sustituto de un NAS o servidor doméstico?

No necesariamente. AI Cube está optimizado para la inferencia de IA con mucha memoria, mientras que un NAS o servidor doméstico se adapta mejor a archivos persistentes, fuentes RAG, bases de datos, copias de seguridad, estado de los agentes y otros servicios siempre activos. Ambas funciones pueden complementarse.

Centro de Tecnología e IA

Más para leer

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.