Gemini 3.1 Pro
Googles Spitzenmodell - stark bei abstraktem Reasoning, aber seit Februar 2026 unverändert.
- Denkleistung 9,0
- Programmieren 8,5
- Agentik 8,3
- Tempo 7,0
- Preis-Leistung 8,0
Gewichtung: Denkleistung 30 % · Programmieren 25 % · Agentik 25 % · Tempo 10 % · Preis-Leistung 10 %
Zum Preis: Über 200K Eingabe-Tokens gelten 4 $ / 18 $ je Million.
Worum es geht
Gemini 3.1 Pro ist nach wie vor Googles Flaggschiff, obwohl es aus dem Februar 2026 stammt. Der Nachfolger 3.5 Pro wurde im Mai auf der Google I/O für „nächsten Monat" angekündigt und ist bis September nicht erschienen - Google testet weiter mit Partnern.
Besonders auffällig ist der Sprung bei ARC-AGI-2 von 31,1 % auf 77,1 % gegenüber dem Vorgänger: ein Benchmark für abstraktes Musterdenken, bei dem Modelle sonst reihenweise scheitern.
Beim Preis gilt eine Schwelle bei 200K Tokens: Darüber steigen die Sätze von 2 $ / 12 $ auf 4 $ / 18 $ je Million.
Neu in dieser Version
Gegenüber dem Vorgänger Gemini 3.0 Pro:
-
Sprung bei ARC-AGI-2
Von 31,1 % auf 77,1 % - der größte veröffentlichte Zuwachs bei diesem Benchmark innerhalb einer Modellgeneration.
-
Millionen-Kontext über die ganze Reihe
Seit 3.1 hat jedes Gemini-Modell bis hinunter zur günstigsten Stufe ein Kontextfenster von 1 Mio. Tokens.
-
Gestaffelter Langkontext-Preis
Neu eingeführt: Ab 200K Tokens gelten 4 $ / 18 $ statt 2 $ / 12 $ je Million.
Stärken und Schwächen
Dafür spricht
- Herausragend bei abstraktem Reasoning (ARC-AGI-2 77,1 %)
- Echte Multimodalität einschließlich Audio und Video
- Tiefe Einbindung in die Google-Cloud-Landschaft
Das schränkt ein
- Seit Februar 2026 keine neue Pro-Version - der Abstand zur Spitze wächst
- Preisaufschlag ab 200K Tokens
- Nachfolger 3.5 Pro mehrfach verschoben
Benchmarks
| Benchmark | Ergebnis | Einordnung |
|---|---|---|
| ARC-AGI-2 | 77,1 % | Vorgänger: 31,1 % |
Benchmark-Werte stammen von den Anbietern oder unabhängigen Auswertungen und sind untereinander nur bedingt vergleichbar.