Ein 27-Milliarden-Modell in 4 GByte RAM: was lokale KI heute wirklich leistet

Quantisierung schrumpft große Sprachmodelle auf normale Hardware. Ein Praxistest zeigt, wo lokale KI trägt und wo das Tempo kippt.

Mehrere Arbeitsspeichermodule nebeneinander auf einer Holzoberfläche

Ein Sprachmodell mit 27 Milliarden Parametern belegt im Originalformat rund 54 GByte Speicher. In komprimierter Form sind es 7,2 GByte, und laufen soll es bereits ab 4 GByte Arbeitsspeicher. heise online hat für die iX mehrere dieser geschrumpften Modelle auf gewöhnlicher Hardware getestet und dabei nicht nur den Speicherbedarf gemessen, sondern auch das Tempo und die Textqualität. Das Ergebnis fällt je nach Gerät sehr unterschiedlich aus.

Wie die Modelle schrumpfen

Der Hebel heißt Quantisierung: Die Gewichte eines Modells werden mit weniger Genauigkeit gespeichert. Statt 16 Bit pro Gewicht sind gängige Formate heute 8 oder 4 Bit. Neuere Ansätze gehen deutlich tiefer. Microsoft zeigte mit BitNet b1.58 einen Weg, Gewichte mit durchschnittlich 1,58 Bit abzulegen, das Startup Prism ML nutzt für sein Modell Bonsai 27B eine ternäre Variante mit rund 1,7 Bit pro Gewicht. Aus 54 GByte werden so 7,2 GByte.

Ein zweiter Weg zielt nicht auf die Gewichte, sondern auf die Architektur. Die Inferenz-Engine Colibri lädt bei einem Mixture-of-Experts-Modell nur die Teilnetze in den Speicher, die für den aktuellen Token gebraucht werden, und streamt den Rest von der SSD nach. Damit läuft GLM 5.2 mit 744 Milliarden Parametern auf einem Rechner mit 32 GByte RAM und ohne Grafikkarte. Aktiv sind pro Token nur etwa 40 Milliarden Parameter, der Rest liegt auf der Platte.

Hand hält ein Speichermodul vor farbigem Hintergrund

Das Tempo entscheidet über die Praxistauglichkeit

Die Speicherwerte klingen spektakulär, die Geschwindigkeitswerte sortieren sie ein. Bonsai 27B erreicht auf einer Nvidia RTX 4070 Super rund 50 Token pro Sekunde, das ist für interaktives Arbeiten ausreichend. Ohne Grafikkarte, auf einem Intel Core i7-14700K, bleiben 2 bis 3 Token pro Sekunde. Auf einem Smartphone mit 8 GByte RAM waren es etwa 2 Token pro Sekunde. Das 744-Milliarden-Modell über Colibri liefert 0,3 Token pro Sekunde, für 1.000 Token Denkleistung vergeht damit ungefähr eine Stunde.

Die Grafikkarte ist der entscheidende Faktor. Ohne sie ist der Betrieb technisch möglich, aber für interaktive Anwendungen zu langsam.

Auch die Textqualität leidet. Im Test schrieb das unkomprimierte Ausgangsmodell fehlerfreies Deutsch, die stark quantisierte Fassung produzierte Rechtschreibfehler und erfundene Wörter. Dieser Effekt ist größenabhängig: Bei sehr großen Modellen jenseits von 300 Milliarden Parametern liegt der Qualitätsverlust durch Quantisierung im Bereich von unter einem Prozent, bei kleineren Modellen ist er deutlich spürbar.

Was sich gegenüber dem Sommer geändert hat

Bonsai 27B war bereits im Juli ein Thema, als das Modell erstmals auf einem iPhone lief. Neu ist nicht die Kompression selbst, sondern die belastbare Messung: Die Werte zeigen jetzt, welche Hardware für welchen Einsatz nötig ist. Die Werkzeugkette ist dabei unspektakulär geworden. llama.cpp führt die quantisierten Formate aus, fertige Modelldateien liegen auf Hugging Face, und selbst für Smartphones gibt es Apps, die den Download und den Betrieb übernehmen.

Was das für Ihr Unternehmen heißt

  • Für Aufgaben mit klarem Rahmen, etwa Klassifizieren, Extrahieren von Feldern aus Dokumenten oder erste Textentwürfe, reicht ein lokales Modell auf einem Rechner mit Grafikkarte aus. Cloud-Abos und Datenabfluss entfallen.
  • Für Dialog, Recherche und längere Denkketten bleibt die Cloud vorerst gesetzt. 2 bis 3 Token pro Sekunde sind kein Arbeitstempo.
  • Der Kostenvergleich läuft über die Hardware: Eine Consumer-Grafikkarte mit ausreichend Speicher amortisiert sich gegen laufende API-Kosten schnell, wenn das Volumen konstant ist.
  • Bei personenbezogenen oder vertraulichen Daten ist lokale Verarbeitung das schlichteste Argument gegenüber Datenschutzbeauftragten und Betriebsrat, weil kein Auftragsverarbeitungsvertrag nötig wird.
  • Planen Sie eine Qualitätsprüfung ein. Stark quantisierte Modelle formulieren merklich schlechter, was bei Texten für Kunden auffällt, bei interner Datenverarbeitung dagegen kaum stört.
Richard von Rüden
Über den Autor Richard von Rüden Senior Entwickler & AI Engineer

Seit über 15 Jahren entwickle ich Websites und Apps und beschäftige mich intensiv mit KI-Automatisierung sowie Datenschutz. In meinen Artikeln teile ich aktuelle News, fundiertes Fachwissen und Erfahrungen aus zahlreichen Projekten.

Kostenlose Beratung
← Zurück zu den News