Alle Modelle

GLM 5.3 Flash

GLM 5.3 Flash ist ein KI-Sprachmodell der chinesischen Firma Z.ai, veröffentlicht am 26. August 2026. Es steht unter der MIT-Lizenz, die Gewichte liegen öffentlich auf Hugging Face, und es liest neben Text auch Bilder. Es hat 320 Milliarden Parameter, von denen pro Anfrage rund 18 Milliarden rechnen. Das ist die kleinere, schnellere Ausführung neben dem größeren GLM 5.3 derselben Generation.

Bei lowcloud ist GLM 5.3 Flash eines von 14 Modellen, die über die Melious AI GmbH auf Servern in der EU laufen. Du wählst es im Chat pro Nachricht, fest für einen Agenten oder für einen einzelnen Schritt eines Ablaufs. Die Anfrage geht dabei nicht an Z.ai, sondern an eine Kopie des Modells auf europäischer Hardware.

Hersteller
Z.ai, China
Kontextfenster
1 Mio. Token
Bilder lesen
ja
Lizenz
MIT
Verarbeitung
EU-Server über Melious

Woher das Modell kommt

Hersteller ist Z.ai aus China. Das Modell erschien am 26. August 2026. Die Lizenz ist MIT. Das ist eine der freiesten Lizenzen überhaupt: kommerzielle Nutzung erlaubt, keine Zusatzauflagen, keine Obergrenze bei den Nutzerzahlen. Bei chinesischen Modellen ist das nicht selbstverständlich, viele erscheinen unter einer eigenen Lizenz mit Bedingungen. Hier trifft das Wort "Open Source" tatsächlich zu: die Gewichte, also die trainierten Zahlenwerte des Modells, stehen öffentlich auf Hugging Face unter zai-org/GLM-5.3-Flash zum Download, dazu eine Variante in anderer Zahlengenauigkeit (BF16). Technisch ist es ein MoE-Modell. MoE steht für Mixture of Experts: das Modell ist in viele Teilnetze zerlegt, pro Anfrage rechnet nur ein kleiner Teil davon. Insgesamt 320 Milliarden Parameter, aktiv pro Anfrage rund 18 Milliarden. Daher der Zusatz Flash. Z.ai beschreibt die Architektur als Mischung aus dünn besetzter und linearer Aufmerksamkeit; das ist eine Herstellerangabe, geprüft haben wir sie nicht. Beim Kontextfenster gibt es widersprüchliche Angaben. Das Kontextfenster ist die Textmenge, die das Modell in einer Anfrage gleichzeitig lesen kann, gemessen in Token; ein Token ist etwa ein halbes bis ganzes Wort. Der lowcloud-Katalog und die Dokumentation von Z.ai nennen 1 Million Token. Die Modellkarte auf Hugging Face nennt 300.000 Token als die in der Auswertung genutzte Obergrenze. Ab welcher Länge die Antwortqualität in der Praxis nachlässt, haben wir nicht gemessen. Einen Nachfolger gibt es zum 7. September 2026 nicht. GLM 5.3 Flash ist der jüngste Stand der GLM-Reihe, zusammen mit dem größeren GLM 5.3.

Was "auf EU-Servern" hier konkret heißt

Die Anfrage läuft über drei Stationen: von dir zur lowcloud UG in Bielefeld, von dort zur Melious AI GmbH in Saarbrücken, von dort in ein Rechenzentrum in der EU. Melious betreibt keine eigenen Rechenzentren, sondern verteilt die Anfragen auf europäische Betreiber. Welcher Betreiber ein bestimmtes Modell bedient, veröffentlicht Melious nicht. Wir wissen es also selbst nicht und können es dir nicht sagen. Wenn dein Kunde diese Auskunft verlangt, ist das der Punkt, an dem die Kette für uns endet. Was feststeht: die Anfrage geht nicht an Z.ai. Weil die Gewichte frei verfügbar sind, läuft das Modell als Kopie auf europäischer Hardware. Der Hersteller sieht deine Eingaben nicht.

Der Unterschied zu GLM 5.3

GLM 5.3 ist das größere Modell derselben Generation, 753 Milliarden Parameter. Es liest nur Text. GLM 5.3 Flash ist kleiner, schneller und das einzige Modell der GLM-Reihe im lowcloud-Katalog, das Bilder lesen kann. Wenn du innerhalb der GLM-Reihe bleiben willst und Bilder verarbeiten musst, ist es die einzige Wahl. Z.ai bezeichnet es als das erste von Grund auf multimodale Modell der GLM-5-Reihe, also als eines, das Bilder nicht nachträglich angebaut bekommen hat. Beide nehmen keine festen JSON-Schemas an. Dazu unten mehr.

Wofür das Modell im Baukasten taugt

Bilder auslesen. Rechnungen, Lieferscheine, Screenshots, Scans, Fotos von ausgefüllten Formularen. Das Modell beschreibt, was darauf steht, und der nächste Schritt im Ablauf arbeitet mit dem Text weiter. Lange Eingaben. Ein Vertrag, ein Protokoll, ein ganzer E-Mail-Verlauf passen in eine Anfrage, ohne dass du den Text vorher zerteilen musst. Schritte, die oft laufen. Weil pro Anfrage nur ein kleiner Teil des Modells rechnet, ist es für Abläufe gedacht, die viele Male am Tag durchlaufen: eingehende Nachrichten einsortieren, Betreffzeilen prüfen, Felder aus einem Text herausziehen, Antwortentwürfe schreiben. Werkzeugaufrufe. Das Modell kann Funktionen anstoßen, also im Ablauf einen Schritt auslösen statt nur Text zurückzugeben. Alltagstext. Zusammenfassen, einordnen, umformulieren, übersetzen.

Wofür es nicht taugt

Feste JSON-Schemas. Ein festes JSON-Schema ist eine Vorlage, die Feldnamen und Datentypen vorschreibt, damit der nächste Schritt sich auf die Struktur verlassen kann. GLM 5.3 Flash nimmt so eine Vorlage nicht an: der Anbieter weist die Anfrage mit einem Fehler zurück. Das ist unsere eigene Beobachtung aus Tests gegen die API, keine Angabe des Herstellers. Die Dokumentation von Z.ai führt "Structured Output (JSON)" als Fähigkeit auf, das meint aber die lose Form, bei der das Modell zu JSON aufgefordert wird, ohne dass ein Schema erzwungen wird. Wenn ein Schritt zwingend ein festes Feldschema braucht, nimm im EU-Katalog ein anderes Modell: Kimi K2.6 (256k Kontext, liest Bilder), GLM 5.1 oder GLM 5 (200k Kontext, keine Bilder), Qwen 3.5 397B (262k Kontext, keine Bilder) oder DeepSeek V4 Flash. Du kannst die Modelle innerhalb eines Ablaufs pro Schritt mischen: Bilder mit GLM 5.3 Flash lesen, das Ergebnis mit Kimi K2.6 in feste Felder bringen. Kunden, die kein in China entwickeltes Modell wollen. Das kommt in Ausschreibungen und internen Richtlinien vor. Im EU-Katalog von lowcloud ist Mistral Small 4 (Mistral AI, Frankreich) das einzige nicht-chinesische Modell; es liest ebenfalls Bilder. Aufgaben, bei denen es auf das stärkste verfügbare Modell ankommt. Z.ai positioniert Flash ausdrücklich als die günstigere und schnellere Ausführung neben GLM 5.3, nicht als das leistungsfähigere Modell.

Was es kostet

Wir nennen hier keine Zahlen. Auf den Einkaufspreis kommt ein Aufschlag, eine hier veröffentlichte Zahl wäre also falsch. Die Einordnung: GLM 5.3 Flash liegt in der zweitgünstigsten Preisstufe des EU-Katalogs von lowcloud. Was ein Lauf tatsächlich gekostet hat, steht in Euro an jedem einzelnen Lauf in der App. Du siehst also pro Ablauf, was er dich gekostet hat, und kannst das an deinen Kunden weiterreichen. Ohne Konto kannst du auf agent.lowcloud.de einen Ablauf bauen lassen; dabei wählt lowcloud das Modell. Die freie Modellwahl kommt mit dem kostenlosen Konto.

GLM 5.3 Flash ausprobieren

Für die Modellwahl brauchst du ein kostenloses Konto. Danach wählst du GLM 5.3 Flash im Chat, pro Agent oder pro Schritt.

Häufige Fragen

Was ist GLM 5.3 Flash?

Ein KI-Sprachmodell der chinesischen Firma Z.ai, veröffentlicht am 26. August 2026, unter MIT-Lizenz. 320 Milliarden Parameter insgesamt, rund 18 Milliarden aktiv pro Anfrage. Es verarbeitet Text und Bilder und ist die kleinere, schnellere Ausführung neben GLM 5.3.

Gehen meine Daten nach China, wenn ich GLM 5.3 Flash nutze?

Nein. Die Gewichte des Modells sind frei verfügbar, deshalb läuft bei lowcloud eine Kopie auf Servern in der EU. Der Weg ist: du zur lowcloud UG in Bielefeld, von dort zur Melious AI GmbH in Saarbrücken, von dort in ein Rechenzentrum in der EU. Z.ai ist an diesem Weg nicht beteiligt und sieht deine Eingaben nicht. Was wir nicht wissen: welcher europäische Betreiber das Modell konkret bedient. Melious veröffentlicht das nicht.

Ist GLM 5.3 Flash Open Source?

Die Lizenz ist MIT, also eine echte freie Lizenz ohne Zusatzauflagen, und die Gewichte stehen öffentlich auf Hugging Face. Bei chinesischen Modellen ist das die Ausnahme, viele nutzen eine eigene Lizenz mit Bedingungen. Der Trainingsdatensatz ist nicht offengelegt, offen sind die fertigen Gewichte.

Kann GLM 5.3 Flash Bilder lesen?

Ja. Es ist das einzige Modell der GLM-Reihe im EU-Katalog von lowcloud, das Bilder verarbeitet. Das größere GLM 5.3 sowie GLM 5.2, GLM 5.1 und GLM 5 nehmen nur Text. Wenn ein Ablauf innerhalb der GLM-Reihe Bilder verarbeiten soll, ist GLM 5.3 Flash die Antwort.

Warum lehnt GLM 5.3 Flash mein JSON-Schema ab?

Weil der Anbieter feste JSON-Schemas nicht annimmt und die Anfrage mit einem Fehler zurückweist. Das haben wir selbst gegen die API geprobt. Ein loses "antworte als JSON" funktioniert, eine erzwungene Feldstruktur nicht. Für Schritte mit festem Schema nimm Kimi K2.6, GLM 5.1, GLM 5, Qwen 3.5 397B oder DeepSeek V4 Flash.

Was kostet GLM 5.3 Flash bei lowcloud?

Wir veröffentlichen keine Preise, weil auf den Einkaufspreis ein Aufschlag kommt. Im EU-Katalog liegt GLM 5.3 Flash in der zweitgünstigsten Preisstufe. Die tatsächlichen Kosten in Euro stehen an jedem einzelnen Lauf in der App.

GLM 5.3 Flash ist ein Produktname von Z.ai. Zwischen lowcloud und Z.ai besteht keine Geschäftsbeziehung; wir betreiben das offen verfügbare Modell über einen europäischen Anbieter. Stand: 7. September 2026.