Gemini 3.8 Flash TTS: Google klont Stimmen aus 30 Sekunden, aber nicht in der EU
Googles neue Sprachmodelle bieten über 2.000 Stimmen und Stimmgestaltung per Text. Das Klonen von Stimmen bleibt im EWR und in der Schweiz gesperrt.
Google hat am 23. September 2026 zwei neue Modelle für die Sprachausgabe veröffentlicht: Gemini 3.8 Flash TTS und Gemini 3.8 Flash-Lite TTS. Beide sind ab sofort über die Gemini API und Google AI Studio nutzbar, eine Variante für Gemini Enterprise soll folgen. Die Modelle laufen ausschließlich in Googles Cloud, offene Gewichte zum Selbstbetrieb gibt es nicht.
Flash TTS ist auf Qualität und Regie ausgelegt, Flash-Lite TTS auf große Mengen zu niedrigen Kosten, etwa für Synchronisation und Sprachagenten.
Stimmen aus einer Beschreibung
Neu ist vor allem die Stimmgestaltung per Text. Statt aus einer festen Liste zu wählen, beschreibt man Rolle, Alter, Akzent und Sprechweise in natürlicher Sprache, und das Modell erzeugt daraus eine Stimme. Daneben stellt Google eine Bibliothek mit mehr als 2.000 fertigen Stimmen bereit, darunter regionale Varianten wie mexikanisches Spanisch, Québec-Französisch und schottisches Englisch. Beim Vorgänger waren es rund 30 Stimmen.
Unterstützt werden nach Googles Angaben mehr als 100 Sprachen und Dialekte. Weitere Funktionen:
- Regieanweisungen pro Zeile, etwa für Tempo, Tonfall, Lachen oder Seufzen
- Dialoge mit zwei Sprechern aus einem einzigen Skript
- lange Aufnahmen über Stunden, bei denen Klangfarbe und Tempo nach Googles Angaben stabil bleiben
Auf dem Voice Design Benchmark des Anbieters Hume AI liegt Flash TTS mit 71,4 Punkten auf Platz eins. Als Partner, die die Modelle bereits einbinden, nennt Google unter anderem Figma, HeyGen, Wondercraft, LiveKit, Agora und Pipecat.
Klonen nur mit Einwilligung und nicht überall
Aus einer Aufnahme von 30 Sekunden lässt sich eine vorhandene Stimme nachbilden. Voraussetzung ist eine gesprochene Einwilligung der Person, deren Stimme verwendet wird. Google gleicht diese Einwilligungsaufnahme mit der Referenzstimme ab, eine fremde Stimme lässt sich so nicht ohne Weiteres übernehmen.
In Google AI Studio ist diese Funktion in mehreren Regionen gesperrt: im Europäischen Wirtschaftsraum, in Großbritannien, der Schweiz, Indien sowie in den US-Bundesstaaten Illinois und Texas. Die übrigen Funktionen, also Stimmgestaltung, Stimmbibliothek und Regie, sind davon nicht betroffen.
Alle erzeugten Audiodateien tragen ein unhörbares SynthID-Wasserzeichen, nachgebildete Stimmen zusätzlich C2PA-Herkunftsnachweise. Beides lässt sich mit passenden Prüfwerkzeugen auslesen, schützt aber nicht davor, dass jemand eine Aufnahme am Telefon für echt hält.
Preise
Google nennt in der Ankündigung keine Preise. Laut The Decoder kostet Flash TTS bis Ende 2026 rund 0,81 US-Dollar je Stunde erzeugter Sprache, Flash-Lite TTS rund 0,54 Dollar. Ab Januar 2027 sollen sich die Preise verdoppeln. MarkTechPost beziffert Flash-Lite TTS mit 0,50 Dollar je Million Eingabe-Token und 6 Dollar je Million Ausgabe-Token.
Was das für Ihr Unternehmen heißt
- Telefonansagen, Warteschleifen, Schulungsvideos und Vorlesefunktionen lassen sich für wenige Cent je Minute in vielen Sprachen erzeugen, ohne Sprecher zu buchen.
- Für Voicebots am Telefon steht eine größere Auswahl natürlich klingender Stimmen bereit, die sich per Beschreibung an die eigene Marke anpassen lassen.
- Wer die Stimme einer bestimmten Person nutzen will, etwa der Geschäftsführung, kann das über AI Studio in der EU derzeit nicht. Unabhängig davon braucht es eine schriftliche Vereinbarung mit der betroffenen Person.
- Texte, die an das Modell gehen, verlassen das eigene Netz. Für Inhalte mit personenbezogenen Daten gehören Auftragsverarbeitung und Datenstandort vorab geprüft.
- Nachgebildete Stimmen werden leichter verfügbar, auch bei Anbietern ohne Einwilligungsprüfung. Anweisungen per Telefon, etwa zu Überweisungen, sollten über einen zweiten Kanal bestätigt werden.