Le recadrage peut concentrer les calculs d’IA de la caméra en éliminant les pixels non pertinents et en agrandissant les zones utiles avant l’inférence, mais uniquement dans le champ sélectionné.
Une caméra d’allée peut consacrer la majeure partie de chaque image au ciel, aux murs et à un véhicule stationné, tandis qu’une personne n’occupe qu’une minuscule zone près du portail. Le traitement d’une région définie ou de tuiles sélectionnées donne à cette zone une plus grande part de la résolution d’entrée fixe du modèle. Ce choix supprime également du contexte et crée des limites où les objets peuvent être tronqués ou manqués.
Un recadrage modifie le nombre effectif de pixels par objet
La plupart des détecteurs redimensionnent l’entrée vers un tenseur de taille fixe. Lorsque l’image grand angle complète est réduite, une personne éloignée peut n’occuper que quelques pixels. Recadrer la zone du portail avant le redimensionnement agrandit cette même personne dans les coordonnées du modèle, ce qui améliore les détails accessibles au détecteur.
L’inférence grossière à fine utilise une stratégie grossière à fine qui prédit les régions susceptibles de contenir de petits objets et traite uniquement des tuiles compactes à une échelle plus fine. L’étude indique qu’elle traite moins de pixels qu’une pyramide d’images complète tout en conservant une qualité de détection similaire.
Les calculs économisés peuvent permettre une résolution régionale supérieure, un modèle plus performant ou une fréquence d’échantillonnage plus élevée. Le gain ne constitue pas une compression magique : les pixels situés en dehors du recadrage ne sont pas disponibles pour cette passe d’inférence et ne peuvent contribuer aux détections.
Les tuiles préservent les détails, mais ajoutent du chevauchement et du travail de fusion
Les tuiles fixes divisent une grande image en recadrages de la taille attendue par le modèle, souvent avec un chevauchement afin qu’un objet proche d’un bord apparaisse entièrement dans la tuile voisine. Chaque recadrage est traité indépendamment, puis les coordonnées sont reconverties dans l’image d’origine et les détections qui se chevauchent sont fusionnées.
Le cadre d’inférence assistée par découpage applique le découpage pour améliorer la détection de petits objets avec différentes familles de détecteurs existantes. Les gains rapportés illustrent l’importance de conserver la résolution locale lorsque le redimensionnement de l’image complète rend les cibles trop petites. Cette distinction reste visible lors des tests domestiques ultérieurs.
Un plus grand nombre de tuiles augmente le nombre d’appels d’inférence, tandis qu’un chevauchement insuffisant tronque les objets et qu’un chevauchement excessif crée des doublons. La suppression non maximale ou la fusion tenant compte du suivi doit réconcilier les boîtes qui représentent le même objet dans des recadrages voisins. Le résultat intermédiaire doit rester inspectable avant le déclenchement de l’automatisation.
Les régions statiques échouent lorsque l’activité utile se déplace
Une région tracée autour d’un porche ne fonctionne que tant que les événements importants s’y déroulent. Un colis déposé juste au-delà du polygone, un changement d’angle de caméra, une correction de l’objectif ou une personne s’approchant par un chemin inattendu peuvent se retrouver en dehors des pixels traités.
Un système d’traitement adaptatif des régions publié en 2026 concentre la détection fine sur des régions sélectionnées automatiquement et indique un compromis entre vitesse et précision par rapport au découpage uniforme. Il identifie également les cibles dispersées et les seuils de génération des régions comme des conditions d’échec. Cette limite doit être mesurée séparément dans des conditions d’utilisation réalistes.
La limite concerne la couverture : exclure l’arrière-plan réduit le travail uniquement en acceptant que les pixels exclus fassent l’objet d’une analyse moindre, voire d’aucune analyse. Les cas d’usage liés à la sécurité, au périmètre et à la détection peuvent nécessiter une passe d’analyse plein cadre peu coûteuse, qui propose des régions dynamiques plutôt que des recadrages permanents et rigides.
Comparez les images complètes avec l’inférence tenant compte des régions
Annotez les événements situés à l’intérieur, à cheval sur et juste à l’extérieur des régions proposées, notamment les petites personnes, les véhicules, les animaux domestiques, les ombres et les mouvements nocturnes. Exécutez les modes plein cadre, recadrage statique, mosaïque et grossier à fin avec le même détecteur, puis mesurez le rappel, les boîtes en double, la latence et le nombre de pixels traités.
Incluez les cas limites grand angle décrits dans les limites des caméras grand angle, car la distorsion et la correction de l’objectif peuvent déplacer un objet par rapport à un polygone enregistré. Examinez les échecs selon leur emplacement plutôt que de vous fier à un seul score moyen de détection.
N’utilisez le recadrage que si les calculs économisés produisent un avantage mesurable sans créer d’angles morts inacceptables. Conservez une passe de découverte plein cadre légère lorsque l’activité peut se déplacer, et ajoutez du chevauchement ou une marge lorsque la troncature aux limites provoque des échecs répétitifs.
Centre Tech & IA
Plus à lire

Quels facteurs déterminent la précision des citations RAG dans une base de connaissances domestique ?
Découvrez pourquoi une source pertinente peut tout de même constituer une mauvaise citation, quelles étapes du pipeline déterminent l’étayage et la couverture, et comment...

Quelles fonctionnalités permettent à un LLM local de générer du JSON fiable ?
Découvrez quelles fonctionnalités imposent la syntaxe JSON, lesquelles garantissent la correction sémantique, et comment tester un modèle local avec différents schémas, prompts et cas...

Traçabilité des données de l’IA locale : pourquoi chaque réponse doit avoir un chemin source traçable
Découvrez comment les chemins source rendent les réponses d’IA locale vérifiables, pourquoi les citations seules sont incomplètes et comment tester la traçabilité lors des...

