KI-News · 7. September 2026

Zehn Prozent
sind der Spitzenwert.

Google hat Gemini 3.8 Flash vorgestellt und die Vergleichstabelle gleich mitgeliefert. Zwei Zahlen darin sind wichtiger als das Modell: Der günstige Preis läuft am 31. Dezember aus. Und beim Test für juristische Abläufe schafft der Beste 10 Prozent.

Lesedauer5 Minuten
KategorieKI-News
QuelleGoogle, 7. September 2026
Stand4. September 2026
GEMINI 3.8 FLASH: 0,75 UND 3,75 DOLLAR JE MILLION TOKENS ZUM VERGLEICH IN GOOGLES TABELLE: OPUS 5 BEI 5 UND 25, GPT 5.6 SOL BEI 4 UND 20 IM PROGRAMMIER-TEST LIEGEN ALLE DREI DICHT BEIEINANDER, 73,7 GEGEN 74,0 GEGEN 72,7 ABER: DER PREIS IST EIN EINFÜHRUNGSPREIS UND VERDOPPELT SICH AM 1. JANUAR 2027 GEMINI 3.8 FLASH: 0,75 UND 3,75 DOLLAR JE MILLION TOKENS ZUM VERGLEICH IN GOOGLES TABELLE: OPUS 5 BEI 5 UND 25, GPT 5.6 SOL BEI 4 UND 20 IM PROGRAMMIER-TEST LIEGEN ALLE DREI DICHT BEIEINANDER, 73,7 GEGEN 74,0 GEGEN 72,7 ABER: DER PREIS IST EIN EINFÜHRUNGSPREIS UND VERDOPPELT SICH AM 1. JANUAR 2027

Nicht das Modell
ist die Nachricht.

Google hat am 7. September Gemini 3.8 Flash veröffentlicht. Interessant ist nicht das Modell, davon kommt jede Woche eines. Interessant ist, dass Google die Vergleichstabelle gleich mitschickt, samt Preisen der Konkurrenz. Wer sie ganz liest, findet zwei Zahlen, die in keiner Schlagzeile stehen. Eine davon steht klein an den Preisen, die andere ganz unten in der Tabelle.

1

Ein Siebtel des Preises,
befristet bis Silvester.

Gemini 3.8 Flash kostet 0,75 Dollar je Million Tokens im Eingang und 3,75 im Ausgang. In Googles eigener Tabelle stehen daneben Claude Opus 5 mit 5 und 25 Dollar und GPT 5.6 Sol mit 4 und 20. Bei der Ausgabe ist das je nach Vergleich das Fünf- bis Siebenfache. Bei den Gütezahlen liegen die drei dagegen dicht beieinander: im Programmier-Test DeepSWE 73,7 gegen 74,0 gegen 72,7 Prozent, beim Terminal-Test 89,4 gegen 89,1 gegen 88,8.

Dazu kam eine zweite Fassung, die in der Mail an Entwickler gar nicht auftaucht: Gemini 3.8 Flash Cyber, ein Modell für Sicherheitsarbeit, das Schwachstellen findet und Korrekturen selbst schreibt. Es gibt sie nicht frei, sondern nur über ein Programm für Behörden und Betreiber kritischer Infrastruktur.

Der eigentliche Fund steht als Fußnote an den Preisen. In der Ankündigung auf dem Google-Blog steht, dass 0,75 und 3,75 Dollar Einführungspreise bis zum 31. Dezember 2026 sind. Ab dem 1. Januar 2027 kostet dasselbe Modell 1,50 und 7,50 Dollar. Das ist keine Preiserhöhung im Kleingedruckten, das ist eine Verdopplung mit Datum, angekündigt am Tag der Veröffentlichung.

ABER: Die Tabelle stammt vom Verkäufer

Google hat die Werte gemessen, die Vergleichsmodelle ausgesucht und die Tests bestimmt. Kein unabhängiges Labor hat das nachgerechnet. Wer Preise vergleicht, sollte außerdem wissen, dass die genannten Konkurrenzpreise Listenpreise sind, ohne Rabatte, ohne zwischengespeicherte Eingaben und ohne die Stufen, die bei langen Anfragen greifen können. Wir hatten genau so einen Fall gerade bei GPT-6 Astra.

Die Tabelle in Zahlen

Eingang je Mio. Tokens0,75 $
Ausgang je Mio. Tokens3,75 $
Ab 1. Januar 20271,50 $ / 7,50 $
Claude Opus 5 (Googles Angabe)5 $ / 25 $
GPT 5.6 Sol (Googles Angabe)4 $ / 20 $
DeepSWE v1.173,7 %
Terminal Bench 2.189,4 %
Test für juristische Abläufe10,0 %
2

Neun von zehn Aufgaben
nicht gelöst.

Ganz unten in derselben Tabelle steht ein Test für komplexe juristische Abläufe. Der beste Wert dort ist 10,0 Prozent, und er gehört Gemini 3.8 Flash. Die anderen liegen bei 8,8, bei 6,7 und bei 2,5 Prozent.

Zehn Prozent heißt: neun von zehn Aufgaben nicht gelöst. In einer Bestenliste, die der Hersteller selbst zusammengestellt hat und in der er naturgemäß gut aussehen will.

Genau dieser Abstand ist die Nachricht. Beim Programmieren, wo es klare Vorgaben, klare Tests und ein klares Richtig gibt, liegen alle bei etwa 90 Prozent. Bei Arbeit, die Aktenlage, Auslegung und Haftung verbindet, liegen alle im einstelligen bis knapp zweistelligen Bereich. Das ist kein Zufall und keine Frage des nächsten Modells. Es ist die Grenze zwischen einer Aufgabe, die man vollständig beschreiben kann, und einer, die man verantworten muss.

ABER: Ein niedriger Wert heißt nicht wertlos

Diese Tests messen, ob ein Modell einen kompletten Fall allein durchbringt. Das ist die härteste Messlatte. In der Praxis wird KI in solchen Bereichen nicht allein gelassen, sondern sortiert vor, findet Textstellen und schreibt Entwürfe. Dafür kann sie sehr nützlich sein, obwohl sie in diesem Test bei 10 Prozent landet. Die Zahl widerlegt nicht den Nutzen, sie widerlegt das Versprechen der Vollautomatik.

Übung für den eigenen Betrieb

Schritt 1Eine wöchentliche Aufgabe wählen
Schritt 2Aufschreiben, woran man Erfolg erkennt
Schritt 3Zehn echte Fälle durchschicken
Schritt 4Zählen, was ohne Nacharbeit durchgeht
Unter 5 von 10KI bleibt Zuarbeit
Zeitaufwandein Nachmittag
Kostenein paar Cent

Der Preis ist die Nachricht, nicht die Güte

Wenn ein Modell mit fast gleicher Leistung ein Siebtel kostet, verschwindet der Vorsprung, den ein Anbieter aus dem Zugang zu einem teuren Werkzeug zieht. Das ist dieselbe Bewegung wie bei der Transkription, die vom Sonderfall zur Selbstverständlichkeit wurde. Wer sein Angebot damit begründet, dass er ein bestimmtes Modell benutzt, verkauft ab jetzt Wasser. Verkauft wird, was ihr damit anstellt, und ob das Ergebnis stimmt.

Was ich
daraus mitnehme.

Ich lese Herstellertabellen inzwischen von unten nach oben. Oben stehen die Werte, die gut aussehen, unten die, die zeigen, wo die Grenze verläuft. In diesem Fall ist der Unterschied zwischen 89 Prozent beim Programmieren und 10 Prozent bei juristischer Arbeit die ehrlichste Aussage der ganzen Ankündigung, und sie kommt vom Hersteller selbst.

Und ich rechne Einführungspreise nicht in Angebote ein. Ein Preis mit Ablaufdatum ist ein Werbepreis. Wer im Herbst kalkuliert und im Januar die Verdopplung erklärt, hat ein Gespräch am Hals, das er sich hätte sparen können. Rechnet mit dem Preis, der ab Januar gilt. Wenn es dann immer noch aufgeht, geht es wirklich auf.

Merken für die Praxis

Gemini 3.8 Flash kostet 0,75 und 3,75 Dollar je Million Tokens, ein Siebtel der genannten Konkurrenz bei der Ausgabe.
Das ist ein Einführungspreis. Ab 1. Januar 2027 sind es 1,50 und 7,50 Dollar, also das Doppelte.
Beim Programmieren liegen alle Modelle bei etwa 90 Prozent, beim Test für juristische Abläufe der Beste bei 10 Prozent.
Alle Zahlen stammen von Google selbst. Prüft mit zehn eigenen Fällen nach, das kostet einen Nachmittag.

Quelle: Google, „Gemini 3.8 Flash and 3.8 Flash Cyber" vom 7. September 2026, dazu die Ankündigung an API-Entwickler aus Google AI Studio vom selben Tag, aus der die Vergleichstabelle stammt, und Googles Auswertungsunterlagen. Sämtliche Werte sind Herstellerangaben. Stand: 07.09.2026.

Gratis-Online-Guide

Der KI-Werkzeugkasten 2026

Welches Modell für welche Aufgabe, welche Tools wirklich zählen und wie du richtig promptest — komplett lesbar, kein Download.

Jetzt gratis lesen →
Kein Spam · Double-Opt-In · Abmeldung jederzeit
✓ Eingetragen — bitte bestätige noch die Mail in deinem Postfach.
Zum KI-Werkzeugkasten →

Zehn Fälle,
statt zehn Meinungen.

Ich setze mich mit dir hin, wir nehmen eine Aufgabe aus deinem Betrieb, schicken zehn echte Fälle durch und zählen aus, was ohne Nacharbeit durchgeht. Danach weißt du, was KI bei dir kann, und musst es nicht glauben.

Kennenlernen →