Gemini 3.8 Live erklärt: Wenn KI gleichzeitig zusehen, sprechen und denken kann

Eva Wong ist die Technische Redakteurin und und leidenschaftliche Tüftlerin bei ZimaSpace. Eine lebenslange Geek mit einer Leidenschaft für Homelabs und Open-Source-Software, sie spezialisiert sich darauf, komplexe technische Konzepte in zugängliche, praktische Anleitungenzu übersetzen. Eva ist der Meinung, dass Self-Hosting Spaß machen und nicht einschüchternd sein sollte. Durch ihre Tutorials befähigt sie die Community, Hardware-Setups zu entmystifizieren, vom Bau ihres ersten NAS bis hin zur Beherrschung von Docker-Containern.

Gemini 3.8 Live ist nicht nur für Sprach-KI relevant. Google hat Echtzeit-Audio- und -Videokontext mit Denken, Tool-Aufrufen und länger laufenden Aufgaben kombiniert, sodass ein Assistent weiter interagieren kann, während die Arbeit im Hintergrund fortgesetzt wird.

Die Bildschirmfreigabe selbst ist nicht neu - Gemini Live unterstützte bereits 2025 die Kamera- und Bildschirmfreigabe. Die größere Veränderung besteht darin, dass KI zunehmend eine sich verändernde Aufgabe beobachten, während des Gesprächs weiterdenken und handeln kann, ohne jeden Schritt in eine separate Eingabeaufforderung zwängen zu müssen. Das verändert auch die Frage nach lokaler KI: Wenn ein Assistent Ihre Umgebung kontinuierlich hören und sehen kann, was sollte lokal gefiltert werden, bevor irgendetwas die Cloud erreicht?

Was ist Gemini 3.8 Live?

Google hat im September 2026 Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking vorgestellt.

Laut Googles offizieller Ankündigung akzeptieren beide Modelle Text, Bilder, Audio und Video und erzeugen Text- oder Audioantworten. Der Unterschied besteht darin, wie viel Arbeit sie während der Live-Sitzung ausführen sollen.

Gemini 3.8 Live Live Extended Thinking
Hauptziel Schnelle Echtzeitinteraktion Komplexe mehrstufige Live-Aufgaben
Denken Verzahntes Denken Erweitertes Denken im Hintergrund
Visuelle Eingaben Ja Ja
Audiointeraktion Ja Ja
Funktionsaufrufe Unterstützt Asynchroner Workflow
Eingabekontext 131.072 Token 131.072 Token
Am besten geeignet für Reaktionsschnelle Live-Assistenten Längere Agentenaufgaben, während das Gespräch weitergeht

Googles Modelldokumentation zufolge ist der standardmäßige Live-Modus für Interaktionen mit geringer Latenz ausgelegt. Extended Thinking ist interessanter, wenn eine Aufgabe Recherche, mehrere Tool-Aufrufe, Vergleiche, Planung oder andere Arbeiten erfordert, die nicht sofort abgeschlossen werden können.

Der neue Teil ist nicht die Bildschirmfreigabe - sondern das Denken, während Sie weiterreden

Viele Demonstrationen lassen Gemini 3.8 Live wie Googles ersten bildschirmbewussten Assistenten wirken. Das ist es nicht.

Google demonstrierte bereits 2025 die Kamera- und Bildschirmfreigabe von Gemini Live. Der frühere Gemini-Live-Leitfaden zeigte Nutzer, die über die Kamera Objekte besprachen und auf einem Smartphone-Bildschirm angezeigte Inhalte diskutierten.

Die wichtige Neuerung in Version 3.8 besteht daher nicht einfach darin, dass Gemini sehen kann.

Es kann den visuellen und akustischen Kontext in Echtzeit nutzen, während ein längerer Denk- oder Tool-Ausführungsprozess weiterläuft.

Stell dir vor, du bittest einen Assistenten, Reiseoptionen zu vergleichen, während du weiter über deine Anforderungen sprichst. Das System muss die Anfrage möglicherweise verstehen, externe Dienste aufrufen, Ergebnisse vergleichen und seinen Plan überarbeiten. Mit Extended Thinking muss diese Arbeit nicht dazu führen, dass das Spracherlebnis in eine lange stille Pause übergeht.

Googles Dokumentation zum Denken der Live API warnt Entwickler sogar davor, dass turnComplete: true nicht unbedingt bedeutet, dass die vollständige Agentenaufgabe abgeschlossen ist. Hintergrundüberlegungen oder asynchrone Tool-Aktivitäten können weiterhin ausgeführt werden.

Das macht eine wichtige architektonische Veränderung sichtbar:

Ein Gesprächsbeitrag und eine Agentenaufgabe sind nicht länger dasselbe.

Das ist bereits die Richtung, die bei der umfassenderen Automatisierung durch KI-Agenten sichtbar wird: Nützliche Agenten behalten zunehmend den Zustand bei und erledigen mehrstufige Aufgaben, anstatt einfach nur eine Eingabe nach der anderen zu beantworten.

Warum bildschirmbewusste KI mehr ist als Screenshot-Erkennung

Ein Screenshot zeigt einer KI einen einzigen eingefrorenen Zustand. Eine Live-visuelle Sitzung vermittelt ihr eine sich verändernde Aufgabe.

Screenshot-KI Live-visuelle KI
Der Nutzer erfasst manuell einen Zustand Der visuelle Kontext ändert sich während der Sitzung
Nach jeder Änderung ist ein neuer Screenshot erforderlich Der Assistent kann einer sich weiterentwickelnden Aufgabe folgen
Der Nutzer erklärt, was sich geändert hat Das Modell kann neue visuelle Informationen empfangen
Gut für isolierte Fragen geeignet Besser für Anleitung und Fehlerbehebung geeignet

Dadurch werden mehrere Szenarien deutlich natürlicher:

  • handschriftliche Mathematik erklären, während der Lernende daran arbeitet;
  • jemanden durch eine unbekannte Anwendung führen;
  • beobachten, wie sich Einstellungen während der Fehlerbehebung ändern;
  • auf eine sich weiterentwickelnde Skizze oder ein Design reagieren;
  • eine Kamera verwenden, um über Geräte oder physische Gegenstände zu sprechen.

Zu Googles Einführungsdemonstrationen gehören visuelles Onboarding für Mitarbeitende, Schach auf einem Live-Brett, die Umwandlung von Skizzen und gesprochenen Anweisungen in UI-Code sowie eine schrittweise Fehlerbehebung. Die gemeinsame Verbesserung ist nicht allein die visuelle Wahrnehmung - sondern in eine laufende Aufgabe eingebettete visuelle Wahrnehmung.

Kontinuierlicher Kontext verändert die Datenschutzgrenze

Bei herkömmlichen Chats ist die Datenabgrenzung relativ eindeutig. Du gibst etwas ein oder lädst ausdrücklich eine Datei hoch.

Ein live arbeitender multimodaler Assistent kann während einer aktiven Sitzung deutlich umfassendere Kontextinformationen empfangen:

  • Mikrofonaufnahmen;
  • Bildschirminhalten;
  • Kamerabildern;
  • auf dem Bildschirm angezeigten Benachrichtigungen;
  • Tool-Ergebnissen;
  • früherem Gesprächskontext.

Die Datenschutzfrage ändert sich daher von:

Habe ich diese Datei hochgeladen?

zu:

Was war sichtbar oder hörbar, während die Sitzung aktiv war?

Ein Entwickler, der seine IDE teilt, kann versehentlich einen API-Schlüssel in einem Terminal offenlegen. Bei einer Bildschirmfreigabe können kurzzeitig private E-Mails, Kundendaten, interne Dashboards oder Benachrichtigungen angezeigt werden, die nichts mit der Aufgabe zu tun haben.

Deshalb sollte die Datenschutzgrenze einer Live-KI-Anwendung vor der Cloud-Anfrage beginnen. Eine lokale Ebene kann entscheiden, welcher Bildschirmbereich, welche Datei, welcher Audioabschnitt oder welcher abgeleitete Kontext das Gerät tatsächlich verlassen muss.

Dasselbe Prinzip gilt, wenn ein KI-Agent Cloud-Tools verwendet: Der Cloud-Zugriff erfordert nicht, dass dem externen Dienst pauschal Zugriff auf jede lokale Datei oder jeden Sensor gewährt wird.

Hört Gemini 3.8 Live ständig zu?

Gemini umgeht die Mikrofonberechtigungen des Betriebssystems nicht, und eine Clientanwendung bestimmt weiterhin, wann eine Live-Sitzung aktiv ist.

Es gibt jedoch ein wichtiges Detail auf API-Ebene: Die Dokumentation zu den Best Practices der Live API von Google besagt, dass proaktives Audio für Gemini 3.8 Live und Extended Thinking dauerhaft aktiviert ist.

Während eine aktive Live-Sitzung zuhört, sammeln sich weiterhin Audioeingabe-Tokens an.

Damit wird ein „ständig aktiver“ Assistent zu zwei Problemen gleichzeitig:

Designproblem Warum das wichtig ist
Datenschutz Der Nutzer muss wissen, wann die Mikrofon- oder Bildaufnahme aktiv ist
Kosten Kontinuierliches Zuhören führt zu fortlaufender Eingabenutzung

Ein ständig aktiver Assistent benötigt daher mehr als nur ein leistungsstarkes Modell. Er braucht gute Aktivierungsregeln, lokale Filterung, einen sichtbaren Sensorstatus und eine sinnvolle Sitzungsverwaltung.

Warum lange Gemini-Live-Sitzungen mehr kosten können, als der Preis pro Minute vermuten lässt

Google berechnet Gemini 3.8 Live derzeit nach Token-Modalität. Die Dokumentation zur API-Preisgestaltung nennt ungefähr folgende Preise:

Modalität Preis der kostenpflichtigen API
Texteingabe 0,75 $ / 1 Mio. Tokens
Audioeingabe 3 $ / 1 Mio. Tokens, etwa 0,005 $/Min.
Bild-/Videoeingabe 1 $ / 1 Mio. Tokens, etwa 0,002 $/Min.
Textausgabe 4,50 $ / 1 Mio. Tokens
Audioausgabe 12 $ / 1 Mio. Tokens, etwa 0,018 $/Min.

Doch die Medienpreise pro Minute machen nur einen Teil der tatsächlichen Kosten aus.

Live-Sitzungen behalten den Gesprächskontext bei. Mit zunehmender Sitzungsdauer kann vorheriger Kontext weiterhin an späteren Gesprächsrunden beteiligt sein. Google empfiehlt daher Kontextfenster-Komprimierung für lang laufende Sitzungen, damit ältere Verlaufsdaten aus dem aktiven Fenster entfernt werden können.

Das führt zu dem, was man als Token-Wachstum in Live-Sitzungen bezeichnen kann: Der Assistent verarbeitet nicht nur die jeweils neueste Sekunde Audio oder Video, sondern führt möglicherweise auch einen zunehmend umfangreichen Gesprächszustand mit.

Die Kostenfrage lautet daher nicht nur:

Wie viel kostet eine Audiominute?

Es ist:

Wie viel Kontext verwendet der Assistent im Verlauf einer längeren Sitzung wieder?

Aus demselben Grund hängen die Kosten hybrider KI stark von der Kontextgröße, dem Modell-Routing und wiederholten Agentenschleifen ab und nicht nur vom Tokenpreis.

Kontinuierliches Video verursacht ein Kontextproblem, nicht nur ein Bandbreitenproblem

Google zufolge fallen bei nativem Audio etwa 25 Token pro Sekunde an. In der Dokumentation zur Live API wird außerdem darauf hingewiesen, dass kontinuierliches Audio-Video ohne Kontextkomprimierung das aktive Kontextlimit wesentlich schneller erreicht als eine reine Audiointeraktion.

Das ist wichtig, weil ein Assistent normalerweise nicht jederzeit jedes mögliche visuelle Detail benötigt.

Wenn der Nutzer beispielsweise nach einem einzelnen Fehlerdialog fragt, erhöht die Übertragung irrelevanter Desktop-Bereiche, Hintergrundfenster und wiederholt unveränderter Einzelbilder:

  • Eingabekontext;
  • Kosten;
  • irrelevantes visuelles Rauschen;
  • Gefährdung der Privatsphäre.

Die bessere Lösung ist nicht einfach ein größeres Kontextfenster.

Es geht um eine bessere Kontextauswahl.

Ein lokaler Client könnte das relevante Fenster zuschneiden, erkennen, wann sich der Bildschirm wesentlich ändert, vertraulichen Text schwärzen oder die Übertragung von Einzelbildern stoppen, wenn nichts Nützliches passiert.

Dadurch wird lokale Verarbeitung zu einer Ebene für Kontextkontrolle, statt zu dem Versuch, das Frontier-Modell zu ersetzen.

Kann Gemini 3.8 Live lokal ausgeführt werden?

Es ist kein offizielles, selbst gehostetes Gemini-3.8-Live-Modell verfügbar.

Google stellt das Modell über seine Cloud-Dienste und die Gemini API bereit. Es gibt keinen herunterladbaren Gemini-3.8-Live-Checkpoint und keine unterstützte Laufzeitumgebung für Consumer-GPUs.

Doch „Gemini selbst kann nicht lokal ausgeführt werden“ und „der gesamte Assistent muss in der Cloud ausgeführt werden“ sind zwei verschiedene Aussagen.

Viele unterstützende Arbeitslasten können lokal bleiben:

Arbeitslast Ist lokale Verarbeitung sinnvoll?
Erkennung des Aktivierungsworts Ja
Erkennung von Sprachaktivität Ja
Erkennung von Bildschirmänderungen Ja
Auswahl eines Bildschirmbereichs Ja
Erkennung sensibler Daten Ja
OCR Oft
Abruf privater Dateien Vorzugsweise
Persönliches Gedächtnis Starker Datenschutzvorteil lokal
Einfache Befehle Oft
Anspruchsvolle multimodale Schlussfolgerungen Ein Cloud-Frontier-Modell kann erheblichen Mehrwert bieten

Ein privater KI-Assistent kann daher persönliche Dateien, Indizes, den Speicher und routinemäßige Verarbeitung lokal halten und nur den ausgewählten Kontext an ein Modell wie Gemini senden, wenn die Aufgabe fortgeschrittene Schlussfolgerungen erfordert.

Warum zukünftige Echtzeitassistenten wahrscheinlich mehrere Modelle verwenden werden

Gemini 3.8 Live für jede Sekunde jeder Aufgabe zu verwenden, wäre leistungsstark, aber selten die effizienteste Lösung.

Ein Assistent in Echtzeit hat viele kleinere Aufgaben:

Aufgabe Effizienter Ausgangspunkt
Sprache erkennen Kleines lokales Audiomodell
Entscheiden, ob eine Anfrage eine Aktion erfordert Kleiner Klassifikator
Sensible Bildschirminhalte erkennen Lokale Bildverarbeitung oder Regeln
Persönliche Dateien durchsuchen Lokale Suche
Einen bekannten Befehl ausführen Lokale Automatisierung
Eine schwierige Live-Szene verstehen Multimodales Frontier-Modell
Eine lange, komplexe Aufgabe koordinieren Agent mit erweitertem Denkvermögen

Das ähnelt der umfassenderen Strategie hinter Cloud-KI der Spitzenklasse mit privaten lokalen Daten: Das Heimsystem muss das Frontier-Modell nicht nachbilden. Es muss entscheiden, welche Informationen das Frontier-Modell erhalten soll.

Das Ergebnis ist weder reine Cloud-KI noch reine lokale KI.

Es handelt sich um ein geroutetes System, bei dem die lokale Verarbeitung häufige, private und einfache Workloads übernimmt, während teure Cloud-Intelligenz für Fälle reserviert bleibt, in denen sie das Ergebnis wesentlich verbessert.

Warum lokale KI wichtiger wird, je besser Live-KI wird

Es mag den Anschein haben, dass ein leistungsfähigeres Cloud-Modell lokale KI weniger relevant macht. Gemini 3.8 Live deutet auf das Gegenteil hin.

Je mehr Kontext ein Cloud-Assistent verarbeiten kann, desto wichtiger wird es, diesen Kontext zu kontrollieren.

Eine nützliche lokale Ebene kann Folgendes behalten:

  • persönliche Dateien;
  • Langzeitgedächtnis;
  • private Abrufindizes;
  • Sensorfilterung;
  • einfache Automatisierungen;
  • Entscheidungen mit geringem Risiko

in der Nähe des Nutzers.

Das Cloud-Modell erhält ausgewählten Kontext nur dann, wenn eine Aufgabe leistungsfähigere Schlussfolgerungen erfordert.

Das verbessert auch die Widerstandsfähigkeit. Ein wirklich offlinefähiger lokaler KI-Workflow kann weiterhin lokale Abrufe, Automatisierungen, Speicherzugriffe und grundlegende Befehle ausführen, selbst wenn cloudbasierte Frontier-Schlussfolgerungen vorübergehend nicht verfügbar sind.

Bei ständig aktiven Workloads kann lokale Verarbeitung außerdem die unnötige Cloud-Nutzung reduzieren. Das ist wichtig, weil wiederholte Mikrofon-, Bildschirm-, Abruf- und Agentenaufrufe einen scheinbar günstigen API-Workflow mit der Zeit teuer machen können.

Gemini 3.8 Live verändert die Benutzeroberfläche von KI

Die wichtigste Veränderung besteht nicht darin, dass Gemini natürlicher spricht oder Bilder genauer erkennt.

Der entscheidende Punkt ist, dass KI den Nutzer zunehmend nicht mehr dazu zwingt, eine laufende Situation in einen sorgfältig vorbereiteten Prompt zu übersetzen.

Anstatt eine Benutzeroberfläche zu beschreiben:

„Ich bin auf einer Einstellungsseite. Die zweite Option ist deaktiviert. Worauf soll ich klicken?“

Der Nutzer kann zunehmend fragen:

„Warum kann ich von hier aus nicht weitermachen?“

Das Modell verfügt bereits über einen Teil des fehlenden Kontexts.

Das beseitigt Reibung, erweitert aber auch die Beobachtungsfläche des Assistenten. Echtzeitfähige persönliche KI braucht daher mehr als ein leistungsfähiges Modell. Sie braucht klare Regeln dafür, welche Sensoren aktiv sind, welcher Kontext behalten wird, was das Gerät verlässt und wann sich das Heranziehen cloudbasierter Schlussfolgerungen lohnt.

Deshalb werden persönliche KI-Agenten zunehmend ebenso Infrastrukturprobleme wie Modellprobleme sein.

Der größere Wandel: Lokale KI wird zur Begrenzungsschicht um hochentwickelte Intelligenz

Gemini 3.8 Live zeigt, was passiert, wenn hochentwickelte KI beständiger und wahrnehmungsfähiger wird.

Der Assistent kann mehr hören, mehr sehen, sich an mehr Kontext erinnern, Tools verwenden und weiter schlussfolgern, während du mit ihm interagierst.

Das macht Cloud-Intelligenz nützlicher - erhöht aber auch den Wert einer lokalen Begrenzungsschicht darum.

Lokale Ebene Hochentwickelte Cloud-Ebene
Private Dateien Komplexes multimodales Reasoning
Persönliches Gedächtnis Langfristige Planung über mehrere Schritte
Bildschirm- und Audiofilterung Fortgeschrittene Live-Unterhaltung
Lokale Suche Schwierige Synthese
Einfache Automatisierungen Hochwertige Agentenaufgaben
Erkennung sensibler Daten Aufgaben, die Cloud-Inferenz rechtfertigen

Das Ziel ist nicht, Gemini aus dem Workflow herauszuhalten. Es geht darum, Informationen, die Gemini von vornherein nicht benötigt, gar nicht erst zu senden.

Sobald KI kontinuierlich sehen, zuhören, schlussfolgern und handeln kann, geht es bei lokaler KI nicht mehr nur darum, Modelle offline auszuführen. Sie wird zur Filter-, Datenschutz-, Gedächtnis- und Routing-Ebene zwischen deiner privaten Welt und hochentwickelter Intelligenz.

Häufig gestellte Fragen zu Gemini 3.8 Live

Was ist der Unterschied zwischen Gemini 3.8 Live und Extended Thinking?

Gemini 3.8 Live legt Wert auf reaktionsschnelle Echtzeitinteraktion. Extended Thinking ist für komplexere Live-Aufgaben konzipiert, bei denen Reasoning und asynchrone Tool-Arbeit im Hintergrund fortgesetzt werden können, während die Unterhaltung aktiv bleibt.

Kann Gemini 3.8 Live deinen Bildschirm sehen?

Gemini Live unterstützt die Bildschirmfreigabe, während Gemini 3.8 Live visuelle Eingaben während Echtzeitsitzungen akzeptiert. Die Clientanwendung bestimmt weiterhin, welche Bildschirm- oder visuellen Daten erfasst und an Googles Cloud-Modell gesendet werden.

Hört Gemini 3.8 Live ständig zu?

Es umgeht keine Geräteberechtigungen. Die API-Dokumentation von Google besagt jedoch, dass proaktives Audio während aktiver Sitzungen mit Gemini 3.8 Live und Extended Thinking dauerhaft aktiviert ist, sodass Audioeingaben weiterhin Tokens erzeugen, während die Sitzung zuhört.

Kann Gemini 3.8 Live lokal ausgeführt werden?

Es ist kein offizieller lokaler Checkpoint und keine selbst gehostete Laufzeitumgebung verfügbar. Unterstützende Funktionen wie Aktivierungsworterkennung, private Suche, Gedächtnis, OCR, Bildschirmfilterung und einfache Befehle können jedoch lokal verarbeitet werden, bevor ausgewählte Kontextdaten an Gemini gesendet werden.

Warum ist lokale KI wichtig, wenn Gemini 3.8 Live leistungsfähiger ist?

Weil leistungsfähigere Live-Modelle mehr private Kontextdaten verarbeiten können. Eine lokale Ebene kann persönliche Daten speichern, Bildschirme und Audio filtern, Routineaufgaben ausführen und nur den Kontext senden, der tatsächlich hochentwickeltes Cloud-Reasoning erfordert.

Tech- & KI-Zentrum

Mehr zum Lesen

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.