La résolution de l’image modifie la charge de l’IA multimodale, car les entrées plus grandes génèrent généralement davantage de patchs visuels, de recadrages, de jetons et de calculs d’attention avant la génération du texte.
Un serveur IA domestique peut répondre rapidement à partir d’une photo de téléphone redimensionnée, mais ralentir face à une capture d’écran en pleine résolution, une page numérisée, un panorama ou une requête contenant plusieurs images. Le nombre initial de pixels n’est pas toujours transmis directement au modèle de langage ; un encodeur visuel redimensionne, recadre, découpe en tuiles et convertit l’image en jetons visuels. La stratégie de prétraitement choisie détermine la quantité de détails fins conservés ainsi que les ressources de calcul, la mémoire, l’espace de contexte et le temps d’attente en file nécessaires à la requête.
Les transformeurs de vision convertissent les pixels en jetons de patch
Un encodeur visuel divise généralement une image en patchs de taille fixe, projette chaque patch dans un plongement, puis traite la séquence obtenue avec des couches de transformeur.
L’article sur le Vision Transformer considère une image comme une séquence de patchs, plutôt que comme une entrée indivisible.
Avec une taille de patch fixe, augmenter à la fois la largeur et la hauteur de l’image crée davantage de patchs, proportionnellement à la surface de l’image. Doubler chaque dimension peut donc produire environ quatre fois plus de patchs bruts avant toute mise en commun ou compression ultérieure.
Le prétraitement peut supprimer des pixels par redimensionnement ou les préserver par découpage en tuiles
Certains pipelines redimensionnent chaque image à une résolution fixe pour l’encodeur. Le nombre de jetons reste stable, mais les petits textes et les objets fins peuvent disparaître lors du sous-échantillonnage.
LLaVA-UHD utilise un découpage en résolution native pour diviser les grandes images en sections de taille variable et organiser les jetons visuels obtenus.
Le découpage en tuiles préserve les détails locaux en traitant plusieurs recadrages, mais chaque recadrage ajouté répète le travail de l’encodeur visuel et fournit des jetons ou des caractéristiques compressées supplémentaires au modèle de langage.
Deux fichiers ayant le même nombre de mégapixels peuvent également produire des dispositions de recadrage différentes, car le rapport hauteur/largeur et les règles de sélection de la grille du moteur d’exécution déterminent le nombre de tuiles nécessaires.
Une résolution supérieure peut multiplier les jetons visuels dans le modèle de langage
Après l’encodage visuel, un projecteur convertit les caractéristiques de l’image en jetons compatibles avec le modèle de langage. Ces jetons occupent des positions du contexte aux côtés du texte de l’utilisateur et de la réponse générée.
LLaVA-OneVision indique que ses étapes AnyRes augmentent le nombre de jetons visuels à mesure que la résolution prise en charge augmente.
Un plus grand nombre de jetons visuels accroît le travail de préremplissage du prompt, les besoins en cache KV et la part du contexte consacrée à l’image plutôt qu’aux instructions de l’utilisateur ou aux documents récupérés.
Une image haute résolution peut donc ralentir la partie langage, même après que l’encodeur visuel a terminé son propre traitement.
Le coût de l’attention dépend de l’endroit où intervient la compression des jetons
Si l’encodeur visuel traite chaque patch avec une attention entièrement auto-régressive, son coût interne peut augmenter rapidement avec le nombre de patchs. Si le modèle de langage reçoit chaque jeton visuel, le préremplissage multimodal augmente également.
Les recherches sur l’accélération haute résolution observent que le mode AnyRes peut créer trois à cinq fois plus de jetons qu’un traitement à plus basse résolution.
La mise en commun des jetons, le rééchantillonnage, la compression apprise et la sélection des recadrages à retraiter peuvent réduire la séquence avant son arrivée dans le modèle de langage. Les économies de calcul dépendent du fait que la compression intervient avant ou après l’étape coûteuse.
La pression liée à la résolution réduit la capacité d’un serveur IA domestique à gérer plusieurs requêtes
Une requête contenant une grande image peut mobiliser la mémoire de l’encodeur visuel, les tenseurs d’image temporaires, le cache KV du modèle de langage et le temps de calcul de l’accélérateur, tandis que d’autres discussions du foyer attendent.
LLaVA-Mini étudie la compression des jetons visuels, car les jetons d’image redondants augmentent le coût de l’inférence multimodale.
La présentation de l’IA locale de ZimaSpace indique que la capacité de l’IA locale dépend du type de charge, et pas uniquement de l’étiquette « IA ».
Un serveur capable de gérer plusieurs discussions textuelles peut accepter moins de requêtes d’images simultanées, en particulier lorsque chaque image utilise un mode de découpage en tuiles très détaillé.
Choisissez la résolution en fonction des éléments que la tâche doit préserver
La classification de scènes, la détection de doublons et l’étiquetage général de photos peuvent fonctionner après un redimensionnement important. L’OCR, les diagrammes, les captures d’écran d’interfaces, les reçus et l’inspection de petits objets nécessitent souvent davantage de détails ou des recadrages ciblés.
CARES montre qu’une sélection adaptative de la résolution peut éviter de traiter chaque image à la résolution maximale disponible.
Testez plusieurs résolutions avec les mêmes images et les mêmes questions. Notez la précision des réponses, l’exhaustivité de l’OCR, le nombre de jetons visuels, la mémoire maximale utilisée, le délai avant le premier jeton et l’effet sur une autre discussion exécutée simultanément.
Le réglage utile est celui qui offre la résolution ou la stratégie de recadrage la plus basse tout en préservant les éléments nécessaires au flux de travail. Davantage de pixels ne sont utiles que si le modèle peut les convertir en de meilleurs résultats pour la tâche.
Centre Tech & IA
Plus à lire

Pourquoi les prédictions de la maison connectée deviennent-elles moins précises après des changements de routine saisonniers ?
Les habitudes saisonnières modifient la relation entre le temps, les capteurs, l’occupation et les actions souhaitées, ce qui rend obsolète un modèle entraîné à...

Pourquoi un NVR domestique manque-t-il des événements brefs lorsque le suivi des objets est activé ?
Le suivi nécessite suffisamment de détections pour commencer et confirmer une trajectoire ; un objet peut donc disparaître brièvement avant que le NVR ne...

Pourquoi les étiquettes des photos générées par l’IA changent-elles après la mise à niveau d’un modèle ?
Une mise à niveau du modèle modifie la représentation et le classement utilisés pour attribuer les étiquettes, de sorte qu’une même photo peut franchir...

