La programación del acelerador influye en la IA doméstica multiusuario al decidir qué solicitudes comienzan, comparten cada iteración, conservan su estado en memoria o esperan detrás de otras tareas.
Varios usuarios del hogar pueden enviar solicitudes con costes muy diferentes: una pregunta breve para controlar las luces, un documento largo, una imagen, una solicitud de voz o un agente que genera muchas llamadas. El acelerador no puede deducir la importancia para el hogar basándose únicamente en el orden de llegada. Un programador debe combinar el orden de la cola, los presupuestos de tokens, el procesamiento por lotes, las prioridades, la admisión en memoria y la permanencia de los modelos, mientras los resultados siguen siendo impredecibles. Las secciones siguientes explican por qué el mismo hardware puede parecer justo, rápido o inutilizable según cómo se tomen esas decisiones.
FIFO Trata el Momento de Llegada como la Única Prioridad
Una cola de primero en entrar, primero en salir es sencilla, pero un prompt o una respuesta largos pueden retrasar muchas solicitudes breves que llegaron después.
Las solicitudes de LLM tienen costes de tokens desiguales, por lo que la equidad basada únicamente en el número de solicitudes puede dar a un usuario mucho más tiempo de acelerador que a otro.
FIFO es predecible con poca carga, pero produce bloqueo al principio de la cola cuando las cargas de trabajo del hogar se vuelven heterogéneas.
El Procesamiento por Lotes Continuo Comparte las Iteraciones entre Usuarios
Los programadores a nivel de iteración pueden añadir nuevas secuencias entre los pasos de decodificación y retirar las que han terminado sin reconstruir un único lote fijo.
La programación por iteraciones de Orca mejora la utilización y permite que varios usuarios avancen a la vez.
Compartir no garantiza la misma velocidad. El programador todavía decide cuántas secuencias entran, con qué frecuencia avanza cada una y si un nuevo preprocesamiento interrumpe las decodificaciones activas.
Las Políticas de Prioridad Protegen las Solicitudes Sensibles a la Latencia
El control por voz y el chat interactivo breve pueden merecer una admisión más rápida que los resúmenes en segundo plano, las incrustaciones o la generación de imágenes.
Llumnix aborda las prioridades de latencia para solicitudes de LLM heterogéneas.
La prioridad debe incluir mecanismos de envejecimiento o cuotas para que las tareas en segundo plano terminen ejecutándose y un usuario preferente no pueda dejar sin recursos al resto del hogar.
La Admisión en Memoria Puede Bloquear una Solicitud Antes del Cómputo
Una solicitud necesita caché KV y espacio de trabajo, además de los pesos del modelo. El programador puede retrasar la admisión incluso cuando las unidades de cómputo parecen estar inactivas, porque no hay suficiente margen de memoria.
La guía de ZimaSpace sobre la presión de memoria multiusuario explica por qué los contextos más largos reducen el número de conversaciones que pueden permanecer activas.
Interrumpir una secuencia libera capacidad, pero puede requerir volver a calcular o restaurar su estado más adelante, convirtiendo la política de memoria en latencia adicional.
El Preprocesamiento y la Decodificación Necesitan un Tratamiento de Programación Diferente
Los preprocesamientos largos utilizan mucho cómputo, mientras que la decodificación de tokens lee repetidamente los pesos y el estado de la caché. Ejecutarlos juntos sin control puede bloquear la salida transmitida.
Sarathi-Serve utiliza una programación sin bloqueos y un preprocesamiento fragmentado para mejorar el rendimiento y limitar las interrupciones de latencia.
Un programador doméstico puede reservar oportunidades de decodificación para las conversaciones activas y dividir los preprocesamientos de documentos grandes, en lugar de permitir que una sola solicitud monopolice una iteración larga.
La Equidad Debe Medirse en Términos Visibles para el Usuario
El rendimiento agregado de tokens por segundo puede mejorar mientras un usuario espera mucho más que otro. Mide el tiempo en cola, el tiempo hasta el primer token, el retraso entre tokens, el tiempo de finalización y la proporción de servicio por usuario o clase de carga de trabajo.
El Contador de Tokens Virtual define la equidad basada en tokens en lugar de contar todas las solicitudes por igual.
Utiliza clases explícitas para voz, chat interactivo, agentes, incrustaciones y tareas de mantenimiento. Después, prueba solicitudes largas y cortas superpuestas para confirmar que la política elegida coincide con las expectativas del hogar.
La programación no puede crear más capacidad de acelerador, pero sí puede decidir si la escasez se manifiesta como una ralentización equitativa, picos de latencia de cola o un usuario bloqueando a todos los demás.
Centro de Tecnología e IA
Más para leer

¿Qué funciones permiten establecer un límite de confianza de IA doméstica alrededor de archivos confidenciales?
Un límite de confianza para la IA doméstica combina cifrado en reposo, permisos de mínimo privilegio, aislamiento del entorno de ejecución y recuperación con...

¿Qué hace que los resultados de búsqueda privados favorezcan los archivos editados con frecuencia?
Los archivos editados con frecuencia obtienen ventajas de posicionamiento cuando cada actualización añade señales de frescura, fragmentos, versiones o interacción sin normalizarlas por fuente.

¿Qué hace que los modelos de presencia del hogar inteligente confundan a los invitados con los residentes?
Los invitados pueden parecer residentes cuando el sistema observa patrones de actividad del hogar, pero carece de una señal de identidad estable de la...

