Claude Opus 5
Das Arbeitspferd der Spitzenklasse: nahe an Fable 5.1, aber zum halben Preis.
- Denkleistung 9,3
- Programmieren 9,2
- Agentik 9,3
- Tempo 7,0
- Preis-Leistung 7,5
Gewichtung: Denkleistung 30 % · Programmieren 25 % · Agentik 25 % · Tempo 10 % · Preis-Leistung 10 %
Worum es geht
Claude Opus 5 ist für die meisten anspruchsvollen Aufgaben die vernünftigere Wahl als das Flaggschiff. Es liegt bei Coding und Agentik nur knapp dahinter, kostet mit 5 $ / 25 $ je Million Tokens aber die Hälfte - und ist damit das Modell, das man tatsächlich in Produktion laufen lässt.
Anders als bei den Vorgängern Opus 4.7 und 4.8 ist der Denkprozess hier standardmäßig aktiv. Wer das Modell aus alten Projekten übernimmt, sollte die Einstellungen prüfen: Ein abgeschaltetes Thinking führt vereinzelt dazu, dass Werkzeugaufrufe als sichtbarer Text statt als echter Aufruf erscheinen - der Lauf sieht erfolgreich aus, tut aber nichts.
Opus 5 ist außerdem eines von zwei Modellen mit „Fast Mode": bis zu 2,5-fache Ausgabegeschwindigkeit gegen Aufpreis (10 $ / 50 $), wenn Latenz wichtiger ist als der Preis.
Neu in dieser Version
Gegenüber dem Vorgänger Claude Opus 4.8:
-
Thinking standardmäßig an
Wird der
thinking-Parameter weggelassen, denkt das Modell adaptiv. Bei Opus 4.8 und 4.7 hieß Weglassen noch „gar nicht denken" - ein Unterschied, der bei Migrationen leicht übersehen wird. -
Server-seitige Fallbacks
Lehnt das Modell eine Anfrage aus Sicherheitsgründen ab, wiederholt die API dieselbe Anfrage automatisch auf einem Ausweichmodell - innerhalb desselben Aufrufs.
-
Task Budgets
Ein Token-Budget für die gesamte Agentenschleife. Das Modell sieht den Countdown und schließt sauber ab, statt mitten im Satz am
max_tokens-Limit zu enden. -
Fast Mode
Bis zu 2,5-fache Ausgabegeschwindigkeit bei gleichem Modell, abgerechnet zu 10 $ / 50 $ je Million Tokens. Nur bei Anthropic direkt, nicht bei den Cloud-Partnern.
-
Systemnachrichten mitten im Gespräch
Betreiberanweisungen lassen sich als
role: "system"an die Nachrichtenliste anhängen, ohne den gecachten Prefix zu zerstören - und sind gegen Prompt Injection abgesichert.
Stärken und Schwächen
Dafür spricht
- Spitzenleistung zum halben Flaggschiff-Preis
- Denkprozess ab Werk aktiv, alle fünf Effort-Stufen verfügbar
- Fast Mode für latenzkritische Anwendungen
- Task Budgets: das Modell kennt sein Token-Budget und arbeitet darauf hin, statt abgeschnitten zu werden
Das schränkt ein
- Bei den härtesten Agenten-Benchmarks knapp hinter Fable 5.1
- Abgeschaltetes Thinking hat zwei stille Fehlermodi - besser niedriger Effort statt „disabled"
- Kein Priority Tier
Benchmarks
| Benchmark | Ergebnis | Einordnung |
|---|---|---|
| SWE-bench Pro | 79,2 % | – |
| Artificial Analysis Intelligence Index | 51 | – |
| DeepSWE v1.1 | 73,7 % | – |
Benchmark-Werte stammen von den Anbietern oder unabhängigen Auswertungen und sind untereinander nur bedingt vergleichbar.