KI & Gesellschaft · 26. September 2026

Ein Gesicht,
das zurückredet.

Bisher war die KI im Kundenkontakt eine Stimme am Telefon oder ein Textfeld auf der Seite. Seit dieser Woche gibt es bei Google ein sichtbares Gegenüber, das zuhört, antwortet und dabei die Lippen bewegt. Das ist kein abgespieltes Video, sondern ein Gespräch. Nur kommst du vorerst nicht dran, und das hat gute Gründe.

Lesedauer6 Minuten
KategorieKI & Gesellschaft
QuelleGoogle, Modellsteckbrief, September 2026
Stand26. September 2026
✦ GEMINI 3.8 LIVE MIT LIVE AVATAR: SPRECHENDES GEGENÜBER IN 97 SPRACHEN ✦ ALLE TON- UND BILDSTRÖME TRAGEN DAS WASSERZEICHEN SYNTHID, ENDPUNKTE AUCH IN DER EU ✦ NUR FÜR GESCHÄFTSKUNDEN, EIGENE GESICHTER NUR NACH FREIGABE ✦ LAUT STECKBRIEF: EIN PAAR MINUTEN AM STÜCK, NICHT STUNDEN ✦ GEMINI 3.8 LIVE MIT LIVE AVATAR: SPRECHENDES GEGENÜBER IN 97 SPRACHEN ✦ ALLE TON- UND BILDSTRÖME TRAGEN DAS WASSERZEICHEN SYNTHID, ENDPUNKTE AUCH IN DER EU ✦ NUR FÜR GESCHÄFTSKUNDEN, EIGENE GESICHTER NUR NACH FREIGABE ✦ LAUT STECKBRIEF: EIN PAAR MINUTEN AM STÜCK, NICHT STUNDEN

Kein Video.
Ein Gespräch.

Der Unterschied, um den es hier geht, ist leicht zu übersehen. Ein Werbevideo mit einem KI-Gesicht läuft eine feste Abfolge ab. Ein Live Avatar muss auf den reagieren, der gerade spricht, auch wenn der dazwischenredet, das Thema wechselt oder etwas fragt, das nicht vorgesehen war. Aus einem Drehbuch wird damit ein Gespräch mit Leitplanken. Genau das hat Google am 24. September vorgestellt.

1

97 Sprachen,
und ein Wasserzeichen.

Die Funktion heißt Gemini 3.8 Live mit Live Avatar und bringt eine sichtbare Figur in Gespräche auf Webseiten, Mobilgeräten und an Kiosken. Nach Angaben von Google beherrscht sie 97 Sprachen, spricht lippensynchron, übernimmt und übergibt das Wort flüssig und erkennt einen Sprachwechsel selbstständig, ohne dass Bild und Ton auseinanderlaufen.

Zwei Punkte daran sind für einen Betrieb in Deutschland wichtiger als die Sprachliste. Erstens gibt es Endpunkte in der EU, die Verarbeitung muss also nicht zwangsläufig über die USA laufen. Zweitens tragen alle erzeugten Ton- und Bildströme das unhörbare Wasserzeichen SynthID. Damit bleibt nachweisbar, dass das Material von einer Maschine stammt, und das ist nichts Lästiges, sondern genau die Richtung, in die auch die Kennzeichnungspflichten gehen.

Beim Gesicht selbst gibt es zwei Wege. Entweder du nimmst eine vorgefertigte Figur aus Googles Sammlung, dann geht es sofort los. Oder du willst ein eigenes Gesicht, erzeugt aus einem einzigen Referenzfoto und einer Tonprobe, und dafür braucht es eine gesonderte Freigabe durch Google samt Prüfverfahren.

Und hier ist die Tür für die meisten zu: Die Funktion läuft über Gemini Enterprise, also den Geschäftskundenzweig mit vertraglich zugesagtem Volumen. Ein Handwerksbetrieb oder eine Kanzlei bucht das nicht am Nachmittag im Selbstbedienungsportal.

ABER: Dass die Tür zu ist, ist hier ein Vorteil

Ein eigenes Gesicht, das aus einem Foto entsteht und dann selbstständig spricht, ist genau die Technik, die man nicht frei zugänglich haben will. Das Prüfverfahren sorgt dafür, dass nicht jeder das Gesicht eines Mitarbeiters, eines Kunden oder einer prominenten Person zum Sprechen bringt. Wer schon einmal gesehen hat, was mit frei verfügbaren Werkzeugen an Fälschungen entsteht, findet diese Bremse richtig.

Die Eckdaten

vorgestellt am24. September 2026
Sprachen97, lippensynchron
WasserzeichenSynthID auf Ton und Bild
EndpunkteUSA und EU
EinsatzWeb, Mobilgerät, Kiosk
ZugangGemini Enterprise, eigenes Gesicht nur mit Freigabe
2

Ein paar Minuten.
Nicht acht Stunden.

Der nüchternste Teil steht nicht in der Ankündigung, sondern im Modellsteckbrief. Dort nennt Google als Grenze einige Minuten durchgehender Interaktion, ausdrücklich nicht mehrere Stunden. Dazu kommen die bekannten Schwächen: Das Modell kann Dinge behaupten, die nicht stimmen, es kann langsam werden, und Verbindungen können abbrechen. Die Wissensbasis endet im Januar 2025, aktuelles Wissen muss also von außen kommen.

Damit ist klar, was das ist und was nicht. Es ist kein Dauerempfang, der acht Stunden am Tresen steht. Es ist ein Werkzeug für kurze, klar umrissene Aufgaben: drei Produktvarianten erklären, durch ein Formular führen, am Kiosk den Weg weisen.

Wenn du das trotzdem vorbereiten willst, und dafür ist jetzt der richtige Zeitpunkt, dann so. Eine Aufgabe festlegen, die klein und umkehrbar ist, samt der Quelle, aus der die Figur ihre Antworten nehmen darf. Fünf normale und zwei unangenehme Fragen aufschreiben, darunter eine, die gar nicht zum Thema gehört, und eine, die das Informationsblatt nicht beantworten kann. Vorher festlegen, wie ein gutes Eingeständnis von Unwissen klingt, statt hinterher über das Aussehen zu diskutieren. Festlegen, wo ein Mensch übernimmt, und dafür sorgen, dass dieser Weg auch wirklich funktioniert.

Und drei Dinge, die bei uns nicht verhandelbar sind: Die Figur muss sich zu erkennen geben, es muss eine Textalternative geben, und man muss das Gespräch jederzeit verlassen können. Wer eine echte Person als Vorlage nimmt, braucht deren Einverständnis, schriftlich, und zwar getrennt von der Frage, ob das Foto technisch taugt.

ABER: Ein Gesicht macht eine schlechte Antwort nicht besser

Die spannendste Prüfung ist nicht, ob der Avatar gut aussieht, sondern ob die Leute damit schneller ans Ziel kommen als mit einer schlichten Textauskunft. Lass dieselbe Aufgabe einmal mit Figur und einmal ohne erledigen. Wenn der Textweg gewinnt, hast du dir eine teure Antwort auf eine Frage gegeben, die niemand gestellt hat. Das ist keine Schwarzmalerei, sondern der billigste Test, den es gibt.

Was im Steckbrief steht

durchgehende Interaktioneinige Minuten
bekannte SchwächenFalschaussagen, Verzögerung, Abbruch
WissensstandJanuar 2025
EingabenTon, Bild, Video, Text
Pflicht bei unsKennzeichnung, Textweg, Ausstieg

Der Pilotzettel, den du heute schon schreiben kannst

Eine Seite, fünf Zeilen: Welche eine Aufgabe soll die Figur übernehmen. Aus welcher Quelle darf sie antworten. Welche fünf normalen und zwei unangenehmen Fragen prüfen wir. Wo übernimmt ein Mensch, und wie schnell. Wie gibt sich die Figur als Maschine zu erkennen. Dieser Zettel ist unabhängig vom Anbieter gültig, und er ist in zwanzig Minuten fertig. Wenn die Technik dann für kleinere Kunden geöffnet wird, startest du, während andere noch Angebote vergleichen.

Was ich
daraus mitnehme.

Mir gefällt, dass Google hier die Bremse eingebaut hat, statt sie später nachzurüsten. Freigabeverfahren für eigene Gesichter, Wasserzeichen in jedem Strom, Endpunkte in der EU. Das sind die drei Punkte, bei denen man später keinen Streit haben will.

Und der Satz aus dem Steckbrief, der die Werbung erdet, lautet: ein paar Minuten, nicht Stunden. Wer daraus einen unermüdlichen Dauerberater macht, hat sich selbst überredet. Die realistische Anwendung ist klein und konkret, und genau dort funktioniert sie vermutlich sehr gut.

Merken für die Praxis

Gemini 3.8 Live mit Live Avatar bringt ein sichtbares, lippensynchrones Gegenüber in Gespräche auf Web, Mobilgerät und Kiosk, nach Angaben von Google in 97 Sprachen.
Alle erzeugten Ton- und Bildströme tragen das Wasserzeichen SynthID, Endpunkte gibt es auch in der EU.
Verfügbar ist das für Gemini Enterprise, ein eigenes Gesicht aus Foto und Tonprobe braucht eine gesonderte Freigabe durch Google.
Der Modellsteckbrief nennt als Grenze einige Minuten durchgehender Interaktion, dazu mögliche Falschaussagen, Verzögerungen und Abbrüche. Geeignet ist das für kurze, klar umrissene Aufgaben.

Quellen: Google, „Introducing Gemini 3.8 Live with Live Avatar" vom 24.09.2026 und Google Cloud zur allgemeinen Verfügbarkeit (Verfügbarkeit für Gemini Enterprise, vorgefertigte Figuren und eigene Figuren aus einem Referenzfoto plus Tonprobe nur nach Freigabeverfahren, 97 Sprachen mit automatischer Erkennung des Sprachwechsels, SynthID auf allen erzeugten Ton- und Bildströmen, Endpunkte in den USA und der EU, Einsatz auf Web, Mobilgerät und Kiosk). Die Grenzen stammen aus dem Modellsteckbrief zu Gemini 3.8 Audio (einige Minuten durchgehende Interaktion statt mehrerer Stunden, mögliche Falschaussagen, Langsamkeit und Abbrüche, Wissensstand Januar 2025). Anlass war der Newsletter von Luxe Prompting vom 26.09.2026, aus dem auch die Anregung zum Pilotzettel stammt. Latenz, Preise und Zugangsbedingungen haben wir nicht selbst geprüft. Stand: 26.09.2026.

Gratis-Online-Guide

Der KI-Werkzeugkasten 2026

Welches Modell für welche Aufgabe, welche Tools wirklich zählen und wie du richtig promptest — komplett lesbar, kein Download.

Jetzt gratis lesen →
Kein Spam · Double-Opt-In · Abmeldung jederzeit
✓ Eingetragen — bitte bestätige noch die Mail in deinem Postfach.
Zum KI-Werkzeugkasten →

Bevor bei euch
ein KI-Gesicht spricht.

Wir schreiben mit dir den Pilotzettel: welche eine Aufgabe, welche Quelle, welche Fragen, wo der Mensch übernimmt und wie die Kennzeichnung aussieht. Herstellerunabhängig, damit ihr startklar seid, wenn die Technik für Betriebe eurer Größe aufgeht.

Kennenlernen →