Google hat am 2. September 2026 Gemini 3.8 Flash vorgestellt – die dritte Flash-Version in sechs Wochen. Der Preis je Token bleibt gleich, die Leistung steigt deutlich, und trotzdem kann deine Rechnung wachsen. Der Grund steht in Googles eigener Ankündigung, wird aber selten zitiert: Das Modell arbeitet härter und verbraucht dabei mehr Token. Hier steht, was neu ist, was es kostet und für wen sich der Wechsel lohnt. Stand: 10. September 2026.

Was Gemini 3.8 ist
Gemini 3.8 kommt in zwei Ausführungen. Gemini 3.8 Flash ist das Arbeitspferd für Entwicklung, agentische Abläufe und mehrstufiges Nachdenken in Fachgebieten. Gemini 3.8 Flash Cyber ist auf Cybersicherheit zugeschnitten und nur über ein Programm für geprüfte Verteidiger zugänglich, nicht frei buchbar.
Bemerkenswert ist die Taktung: 3.7 Flash erschien drei Wochen vorher, 3.8 ist die dritte Flash-Version in sechs Wochen. Wer eine Anwendung baut, sollte den Modellnamen deshalb als austauschbaren Parameter behandeln und nicht fest verdrahten. Wie sich die Generationen der Anbieter zueinander verhalten, ordnet der Guide KI-Benchmarks ein.
Gleicher Preis, andere Rechnung
Google nennt für 3.8 Flash dieselben Beträge wie für 3.7 Flash: 0,75 US-Dollar je Million Token Eingabe und 3,75 US-Dollar je Million Token Ausgabe. Das ist im Vergleich zu den Spitzenmodellen sehr wenig.
| je Million Token | Gemini 3.8 Flash | Claude Fable 5.1 | GPT-6 Astra |
|---|---|---|---|
| Eingabe | 0,75 $ | 10 $ | 10 $ |
| Ausgabe | 3,75 $ | 50 $ | 50 $ |
| Verhältnis zur Spitzenklasse | rund ein Dreizehntel | – | – |
Die dritte Zeile erklärt, warum diese Modellklasse überhaupt existiert. Für Aufgaben, die keine Spitzenleistung brauchen, ist der Unterschied nicht ein paar Prozent, sondern eine Größenordnung. Die Preise der beiden Spitzenmodelle stehen in den Guides Claude Fable 5.1 und GPT-6 Astra.
Google bezeichnet die 0,75 und 3,75 US-Dollar in der Ankündigung als Einführungspreis und versieht die Angabe mit einer Fußnote. Ein Enddatum nennt der Ankündigungstext nicht, und auf der Preisseite der Entwicklerschnittstelle steht dazu ebenfalls keines. Wer damit kalkuliert, sollte den Posten also als vorläufig behandeln und nicht als Grundlage für eine Jahresplanung. Eine Zahl, die man nirgends belegt findet, gehört nicht in eine Kalkulation – auch dann nicht, wenn sie in Zusammenfassungen kursiert.
Warum die Rechnung trotzdem steigen kann
Das ist der Punkt, den Google selbst benennt und der in den Meldungen fast überall fehlt. In der Ankündigung heißt es sinngemäß, 3.8 Flash arbeite härter: Es führe bei komplexen Aufgaben zusätzliche Denkschritte aus und rufe Werkzeuge wiederholt auf. Google schreibt weiter, das Modell verbrauche dabei unter Umständen mehr Token, um die Leistung zu maximieren – besonders auf höheren Aufwandsstufen.
Google schreibt selbst, 3.8 Flash führe zusätzliche Denkschritte aus und verbrauche dabei mehr Token, besonders auf höheren Aufwandsstufen. Der Preis je Token bleibt gleich. Die 50 Prozent sind eine Annahme zur Veranschaulichung – wie viel mehr es tatsächlich ist, nennt Google nicht. Deshalb: vor und nach dem Wechsel an zwanzig echten Anfragen messen.
Die Rechnung ist trivial und genau deshalb wichtig: Ein Preis je Token sagt nichts über die Rechnung, solange die Zahl der Token offen ist. Verbraucht ein Modell bei gleicher Aufgabe die Hälfte mehr Token, steigt der Posten um die Hälfte – auch wenn im Preisblatt keine Zahl sich geändert hat. Wer von 3.7 auf 3.8 wechselt und danach eine höhere Rechnung sieht, hat keinen Abrechnungsfehler vor sich, sondern das erwartete Verhalten.
Der konkrete Schritt daraus: Miss vor dem Wechsel an zwanzig echten Anfragen die durchschnittliche Zahl der Ausgabe-Token, wiederhole die Messung nach dem Wechsel und vergleiche die beiden Zahlen, nicht die Preisblätter. Das dauert eine halbe Stunde und ist die einzige Methode, die dir sagt, ob der Wechsel bei dir günstiger ist.
Google nennt das Gegenmittel selbst: niedrigere Aufwandsstufen wählen, oder für effizienzkritische Lasten bei 3.7 Flash bleiben, das weiter unterstützt wird. Das Prinzip einstellbarer Denktiefe ist dasselbe wie bei OpenAIs Astra.
Was das Modell leistet
Google nennt unter anderem 54,9 Prozent auf HLE-Verified und beschreibt 3.8 Flash als besser als größere und teurere Modelle beim eigenständigen Lösen langlaufender Entwicklungsaufgaben. Dazu kommen Bestwerte in fachlichen Prüfungen aus Finanzanalyse und juristischer Arbeit.
Zwei Einordnungen gehören dazu. Erstens stammen alle diese Werte vom Anbieter, mit eigenem Prüfaufbau. Zweitens ist die interessante Aussage nicht der Spitzenwert, sondern das Preis-Leistungs-Verhältnis: Ein Modell, das an die Spitzenklasse heranreicht und ein Dreizehntel kostet, verschiebt die Frage von Welches ist das beste Modell? zu Welches ist für diese Aufgabe gut genug?
| Deine Aufgabe | Sinnvolle Wahl |
|---|---|
| Große Mengen gleichartiger Texte verarbeiten | 3.8 Flash auf niedriger Aufwandsstufe |
| Agentische Abläufe über viele Schritte | 3.8 Flash – dafür ist die Version gebaut |
| Kosten sind die harte Grenze | 3.7 Flash weiternutzen, Google empfiehlt das ausdrücklich |
| Anwendung mit viel wiederholtem Kontext | Zwischenspeicher vergleichen, nicht Kopfpreise |
| Schwierige Einzelfälle, bei denen ein Fehler teuer ist | Spitzenmodell, der Preisvorteil trägt hier nicht |
Die Variante, über die kaum jemand spricht
Gemini 3.8 Flash Cyber ist auf das Finden und Beheben von Schwachstellen ausgelegt. Google berichtet aus dem eigenen Haus, das Chrome-Sicherheitsteam habe damit 2,6-mal so viele korrekte Fehlerbehebungen erzeugt wie mit deutlich größeren kommerziellen Modellen, und ein Sicherheitsteam habe eine kritische Schwachstelle in unter zwei Stunden gefunden, wofür sonst Monate veranschlagt sind.
Das ist bemerkenswert, weil es zeitlich mit einer neuen Pflicht zusammenfällt: Seit dem 11. September 2026 müssen Hersteller aktiv ausgenutzte Schwachstellen binnen 24 Stunden melden – dazu der Guide Cyber Resilience Act. Bessere Werkzeuge zum Finden von Lücken bedeuten dann auch: mehr gefundene Lücken, über die entschieden werden muss.
Ehrlich dazu gehört die andere Seite. Dieselben Fähigkeiten sind grundsätzlich in beide Richtungen nutzbar. Google beschränkt den Zugang deshalb auf geprüfte Verteidiger und gibt an, das Beheben von Schwachstellen bewusst vor dem Ausnutzen priorisiert zu haben. Ob diese Beschränkung dauerhaft trägt, ist eine offene Frage, keine beantwortete.
Häufige Fragen
Was ist Gemini 3.8 Flash?
Googles Arbeitspferd-Modell, vorgestellt am 2. September 2026, mit deutlichen Verbesserungen bei Softwareentwicklung, agentischen Aufgaben und mehrstufigem Nachdenken. Es ist die dritte Flash-Version innerhalb von sechs Wochen.
Was kostet Gemini 3.8 Flash?
0,75 US-Dollar je Million Token Eingabe und 3,75 US-Dollar je Million Token Ausgabe. Google bezeichnet das ausdrücklich als Einführungspreis; ein Enddatum nennen weder die Ankündigung noch die Preisseite.
Warum steigt meine Rechnung trotz gleicher Preise?
Weil das Modell laut Google mehr Token verbraucht: Es führt zusätzliche Denkschritte aus und ruft Werkzeuge wiederholt auf, besonders auf höheren Aufwandsstufen. Der Preis je Token bleibt, die Zahl der Token steigt.
Soll ich von Gemini 3.7 auf 3.8 wechseln?
Wenn Leistung zählt, ja. Wenn Kosten die harte Grenze sind, empfiehlt Google selbst, für effizienzkritische Lasten bei 3.7 Flash zu bleiben. Entscheide anhand gemessener Token je Anfrage vor und nach dem Wechsel, nicht anhand der Preisblätter.
Was ist Gemini 3.8 Flash Cyber?
Eine auf Cybersicherheit ausgerichtete Variante zum Finden und Beheben von Schwachstellen. Sie ist nicht frei verfügbar, sondern nur über ein Programm für geprüfte Verteidiger zugänglich, etwa Behörden und Betreiber kritischer Infrastruktur.
Wie belastbar sind die genannten Leistungswerte?
Sie stammen vom Anbieter und beruhen auf dessen Prüfaufbau. Aussagekräftiger als der Spitzenwert ist das Preis-Leistungs-Verhältnis – und für die eigene Anwendung ein Test mit echten Aufgaben.
Nicht das beste Modell, sondern das passende
Drei Modellversionen in sechs Wochen – was bleibt, ist die Fähigkeit, Aufgaben sauber zu stellen und Ergebnisse zu beurteilen. Genau daran arbeiten wir in unserer geförderten Weiterbildung an Aufgaben aus deinem Berufsfeld. Ob eine Förderung in Betracht kommt, klären wir im kostenlosen Erstgespräch; entschieden wird sie von der Agentur für Arbeit.
Kostenloses Erstgespräch sichern
Benedikt Backhaus – schreibt bei Scaly über KI-Tools, neue Modelle und aktuelle Entwicklungen rund um künstliche Intelligenz. Preise und Funktionsangaben prüft er an den Seiten der Anbieter, nicht an Vergleichsportalen – Stand jeweils im Text. Einschätzung, keine Rechtsberatung. Benedikt auf LinkedIn