Zuschneiden kann die Kamera-KI-Berechnung fokussieren, indem irrelevante Pixel verworfen und nützliche Bereiche vor der Inferenz vergrößert werden – allerdings nur innerhalb des ausgewählten Sichtfelds.
Eine Auffahrtskamera kann den Großteil jedes Bildes auf Himmel, Wände und ein geparktes Fahrzeug verwenden, während eine Person nahe dem Tor nur einen winzigen Bereich einnimmt. Die Verarbeitung eines definierten Bereichs oder ausgewählter Kacheln weist diesem Bereich mehr von der festgelegten Eingabeauflösung des Modells zu. Dieselbe Auswahl entfernt jedoch Kontext und schafft Grenzen, an denen Objekte abgeschnitten oder übersehen werden können.
Ein Zuschnitt verändert die effektive Pixelzahl pro Objekt
Die meisten Detektoren skalieren die Eingabe auf einen Tensor mit fester Größe. Wird das gesamte Breitbild verkleinert, kann eine weit entfernte Person nur wenige Pixel einnehmen. Durch das Zuschneiden des Torbereichs vor der Skalierung erscheint dieselbe Person in den Modellkoordinaten größer, wodurch dem Detektor mehr verwertbare Details zur Verfügung stehen.
Coarse-to-Fine-Inferenz verwendet eine Strategie vom Groben zum Feinen, die wahrscheinliche Bereiche mit kleinen Objekten vorhersagt und nur kompakte Ausschnitte in höherer Auflösung verarbeitet. Die Arbeit berichtet von weniger verarbeiteten Pixeln als bei einer vollständigen Bildpyramide, bei gleichzeitig ähnlicher Erkennungsqualität.
Die eingesparte Rechenleistung kann eine höhere regionale Auflösung, ein leistungsfähigeres Modell oder eine höhere Abtastrate ermöglichen. Der Vorteil ist keine magische Komprimierung: Pixel außerhalb des Zuschnitts stehen diesem Inferenzschritt nicht zur Verfügung und können nicht zur Objekterkennung beitragen.
Kacheln bewahren Details, erhöhen jedoch Überlappungs- und Zusammenführungsaufwand
Feste Kacheln teilen ein großes Bild in Crops mit Modellgröße auf, oft mit Überlappung, damit ein Objekt nahe einer Kante vollständig in der benachbarten Kachel erscheint. Jeder Crop wird unabhängig verarbeitet; anschließend werden die Koordinaten zurückübersetzt und überlappende Erkennungen zusammengeführt.
Das Slicing-gestützte Inferenzverfahren setzt Slicing ein, um die Erkennung kleiner Objekte über verschiedene bestehende Detektorfamilien hinweg zu verbessern. Die berichteten Verbesserungen zeigen, warum der Erhalt der lokalen Auflösung wichtig sein kann, wenn Objekte durch die Skalierung des Gesamtbildes zu klein werden. Dieser Unterschied bleibt auch bei späteren Tests im Haushalt sichtbar.
Mehr Kacheln erhöhen die Anzahl der Inferenzaufrufe, während eine zu geringe Überlappung Objekte abschneidet und eine zu große Überlappung Duplikate erzeugt. Non-Maximum-Suppression oder eine trackbasierte Zusammenführung müssen Boxen abgleichen, die dasselbe Objekt in benachbarten Crops darstellen. Das Zwischenergebnis muss überprüfbar bleiben, bevor eine Automatisierung darauf aufbaut.
Statische Bereiche versagen, wenn sich relevante Aktivitäten bewegen
Ein um eine Veranda eingezeichneter Bereich funktioniert nur, solange wichtige Ereignisse dort stattfinden. Ein Paket, das knapp außerhalb des Polygons abgelegt wird, ein veränderter Kamerawinkel, eine Objektivkorrektur oder eine Person, die sich auf einem unerwarteten Weg nähert, kann außerhalb der verarbeiteten Pixel liegen.
Ein adaptives Verfahren zur regionalen Verarbeitung aus dem Jahr 2026 konzentriert die detaillierte Erkennung auf automatisch ausgewählte Bereiche und berichtet über einen Kompromiss zwischen Geschwindigkeit und Genauigkeit im Vergleich zu gleichmäßiger Aufteilung in Kacheln. Zudem identifiziert es spärlich verteilte Ziele und Schwellenwerte für die Bereichserzeugung als Fehlerbedingungen. Diese Grenze sollte unter realistischen Betriebsbedingungen separat gemessen werden.
Die Grenze ist die Abdeckung: Das Ausschließen des Hintergrunds reduziert den Aufwand nur, indem akzeptiert wird, dass ausgeschlossene Pixel weniger oder gar nicht analysiert werden. Für Sicherheits-, Perimeter- und Erkennungsanwendungen kann ein kostengünstiger Durchlauf über das gesamte Bild erforderlich sein, der dynamische Bereiche vorschlägt, anstatt dauerhaft harte Zuschnitte zu verwenden.
Gesamtbilder mit bereichsbewusster Inferenz vergleichen
Markieren Sie Ereignisse innerhalb, über und knapp außerhalb der vorgeschlagenen Bereiche, darunter kleine Personen, Fahrzeuge, Haustiere, Schatten und Bewegungen bei Nacht. Führen Sie die Modi für das gesamte Bild, statische Zuschnitte, Kacheln sowie Grobe-bis-feine-Verarbeitung mit demselben Detektor aus und messen Sie Trefferquote, doppelte Boxen, Latenz und die Anzahl der verarbeiteten Pixel.
Beziehen Sie die in den Grenzen von Weitwinkelkameras beschriebenen Weitwinkel-Sonderfälle ein, da Verzerrung und Objektivkorrektur die Position eines Objekts relativ zu einem gespeicherten Polygon verändern können. Untersuchen Sie Fehlstellen nach ihrem Ort, statt sich auf einen einzigen durchschnittlichen Erkennungswert zu verlassen.
Verwenden Sie Zuschnitte nur, wenn die eingesparte Rechenleistung einen messbaren Vorteil ohne unannehmbare blinde Bereiche bringt. Behalten Sie einen ressourcenschonenden Durchlauf über das gesamte Bild zur Erkennung neuer Aktivitäten bei, wenn sich diese bewegen können, und ergänzen Sie Überlappung oder Randzugaben, wenn das Abschneiden an Grenzen wiederholt zu Fehlstellen führt.
Tech- & KI-Zentrum
Mehr zum Lesen

Welche Faktoren bestimmen die Genauigkeit von RAG-Zitaten in einer heimischen Wissensdatenbank?
Erfahren Sie, warum eine relevante Quelle dennoch ein falsches Zitat sein kann, welche Pipeline-Phasen die Belegbarkeit und Abdeckung steuern und wie sich RAG-Aussagen zu...

Welche Funktionen ermöglichen eine zuverlässige JSON-Ausgabe von einem lokalen LLM?
Erfahren Sie, welche Funktionen die JSON-Syntax erzwingen, welche die semantische Korrektheit schützen und wie Sie ein lokales Modell über verschiedene Schemas, Prompts und Fehlerfälle...

Herkunft lokaler KI-Daten: Warum jede Antwort einen nachvollziehbaren Quellenpfad benötigt
Erfahren Sie, wie Quellpfade lokale KI-Antworten überprüfbar machen, warum Zitate allein unvollständig sind und wie sich die Herkunft durch Aktualisierungen und Löschungen testen lässt.

