Muse Spark 1.3
Metas proprietäres Spitzenmodell - 1 Mio. Kontext, Bild- und Videoeingabe, zum Mittelklassepreis.
- Denkleistung 8,3
- Programmieren 8,5
- Agentik 8,3
- Tempo 7,5
- Preis-Leistung 8,3
Gewichtung: Denkleistung 30 % · Programmieren 25 % · Agentik 25 % · Tempo 10 % · Preis-Leistung 10 %
Zum Preis: Standardtarif. Contributor-Tarif 0,10 $ / 0,20 $ nur gegen Freigabe der Daten zum Training. Websuche zusätzlich 2,50 $ je 1.000 Anfragen.
Worum es geht
Mit Muse Spark hat Meta im April 2026 den Kurs gewechselt: Statt offener Llama-Gewichte gibt es ein geschlossenes Frontier-Modell aus den Meta Superintelligence Labs, das die eigenen Produkte antreibt und per API angeboten wird. Version 1.3 vom 2. September 2026 ist auf langlaufende Agenten, Multi-Agent-Setups und Coding ausgelegt.
Der Preis von 1,25 $ / 4,25 $ je Million Tokens liegt zwischen Gemini Flash und Claude Sonnet 5. Daneben gibt es einen „Contributor"-Tarif für 0,10 $ / 0,20 $ - im Gegenzug darf Meta auf Prompts und Antworten trainieren. Für Anwendungen mit Kunden- oder Geschäftsdaten scheidet dieser Tarif aus.
Bei Long-Context-Aufgaben führt 1.3 das Feld an, bei Agenten-Auswertungen liegt Claude Opus 5 laut Metas eigenen Zahlen in vier von sechs Tests vorn. Auffällig: Das Modell erzeugt rund dreimal so viele Ausgabe-Tokens wie Version 1.2 - der niedrige Listenpreis relativiert sich also je nach Aufgabe.
Neu in dieser Version
Gegenüber dem Vorgänger Muse Spark 1.2:
-
Long Context
Deutlicher Sprung bei den MRCR-Tests auf 98,5 bzw. 98,1 % - das Modell verliert im Millionen-Fenster kaum noch Details.
-
Sparsamere Werkzeugnutzung
Etwa 20 % weniger Tool-Calls pro Aufgabe, dafür mehr Text pro Antwort - insgesamt rund dreifache Token-Ausgabe gegenüber 1.2.
-
Vorsichtigeres Agentenverhalten
Klärungsfragen bei mehrdeutigen Aufträgen und Rückfrage vor Aktionen, die sich nicht rückgängig machen lassen.
-
Contributor-Tarif
Ein Achtel des Standardpreises, wenn Meta die Ein- und Ausgaben zum Training nutzen darf.
Stärken und Schwächen
Dafür spricht
- Spitzenwerte bei Long-Context-Aufgaben (MRCR 98,5 %)
- Text, Bild und Video als Eingabe bei 1 Mio. Kontext
- Rund 20 % weniger Werkzeugaufrufe als 1.2 bei gleicher Aufgabe
- Fragt bei Unklarheit nach und holt vor irreversiblen Aktionen Bestätigung ein
Das schränkt ein
- Erzeugt etwa dreimal so viele Ausgabe-Tokens wie Version 1.2 - frisst einen Teil des Preisvorteils
- Contributor-Tarif nur gegen Trainingsfreigabe - für DSGVO-relevante Daten ungeeignet
- Höchste Effort-Stufe „max" zum Start noch nicht freigegeben
- Proprietär: anders als Llama nicht selbst hostbar
Benchmarks
| Benchmark | Ergebnis | Einordnung |
|---|---|---|
| MRCR (Long Context) | 98,5 % | Angabe von Meta |
Benchmark-Werte stammen von den Anbietern oder unabhängigen Auswertungen und sind untereinander nur bedingt vergleichbar.