
Die Z.ai API bringt die vollständige GLM-Serie von ZhipuAI in deinen Stack – von GLM-4.6 bis zum Flaggschiff GLM-5.1, das unter den Open-Source-Modellen auf SWE-Bench Pro den ersten Platz belegt und autonome Coding-Agents stundenlang ausführt. GLM kombiniert einen Kontext von 202K Token mit ausgewogener Ausgabe auf Chinesisch und Englisch unter einer freizügigen MIT-Lizenz. Atlas Cloud stellt jedes Modell über einen OpenAI-kompatiblen Schlüssel bereit – mit Day-0-Zugriff und transparenter Preisgestaltung pro Aufruf. Starte noch heute.
Treiben Sie Chat, Reasoning und Agenten im großen Maßstab mit führenden großen Sprachmodellen an – schnell und kostengünstig bereitgestellt auf Atlas Cloud.
Compare standard vs. our pricing across every Z.ai model.
| Model | Standard Price (USD) | Our Price (USD) | Discount | |
|---|---|---|---|---|
| GLM 5.2 | $1.4/$4.4per 1M tokens1048.6K context | $1.26/$3.96M in/outper 1M tokens1048.6K context | -10% | View |
| GLM 5.1 | $1.4/$4.4per 1M tokens202.8K context | $1.26/$3.96M in/outper 1M tokens202.8K context | -10% | View |
| GLM 5v Turbo | $1.2/$4per 1M tokens202.8K context | $1.2/$4M in/outper 1M tokens202.8K context | — | View |
| GLM 5 | $1/$3.2per 1M tokens202.8K context | $0.95/$3.15M in/outper 1M tokens202.8K context | — | View |
| GLM 4.7 | $0.6/$2.2per 1M tokens202.8K context | $0.52/$1.85M in/outper 1M tokens202.8K context | — | View |
| GLM 4.6 | $0.6/$2.2per 1M tokens202.8K context | $0.6/$2.2M in/outper 1M tokens202.8K context | — | View |
Instantly explore and experiment with 400+ production-ready models in the Atlas Playground. Start customizing with one click.
Die Modellstufen von GLM decken alles ab, von schnellen zweisprachigen Chat-Aufgaben bis hin zu mehrstündigen autonomen Coding-Agenten. Teams verwenden GLM-5.1 für langfristige Ingenieursarbeiten und GLM-4.7 oder GLM-5 Turbo, wenn Kosteneffizienz und Geschwindigkeit im Vordergrund stehen.
Engineering teams use GLM-5.1 to run autonomous optimization agents that iterate on production systems over hundreds of rounds. In a documented run, GLM-5.1 improved a vector database through 600 iterations and 6,000 tool calls, reaching 21,500 queries per second — six times the result achievable in a single 50-turn session. Atlas Cloud's pay-as-you-go pricing makes it practical to run these extended sessions without pre-purchasing capacity.
Entwicklungsteams nutzen GLM-5.1, um vollständige Codebasis-Transformationen über mehrstündige Sitzungen hinweg ohne menschliche Checkpoints durchzuführen. Das Modell plant, schreibt, testet und iteriert Änderungen kontinuierlich für bis zu 8 Stunden und verarbeitete in einer demonstrierten Erstellung eines Linux-Systems von Grund auf 655 Iterationen. Dies ersetzt wochenlange manuelle Refactoring-Arbeit an großen, Legacy-Codebasen.
Entwicklertools-Teams integrieren GLM-5.1 und GLM-5 Turbo als zugrunde liegendes Modell für KI-Programmier-Workflows in Claude Code, Kilo Code, Cline, Roo Code und OpenCode. Die Z-AI API auf Atlas Cloud ist OpenAI-kompatibel, sodass der Austausch der base URL die einzige Änderung ist, die erforderlich ist, um eines dieser Tools über GLM zu leiten. Das 262K-Kontextfenster von GLM-5 Turbo macht es besonders geeignet für großen Dateikontext in IDE-Workflows.
Betriebsteams entwickeln mit GLM-5 Support-Agenten, die den Zugriff auf die Ticket-Datenbank, die Suche in der Wissensdatenbank und Eskalationswerkzeuge kombinieren, um wiederkehrende Anfragen ohne menschliches Eingreifen zu bearbeiten. Die Multi-Tool-Aufrufe und die Streaming-Unterstützung des Modells machen es praktisch für Echtzeit-Einsätze mit Kundenkontakt. Durch die zweisprachige Unterstützung bearbeitet derselbe Agent chinesische und englische Tickets über einen einzigen Modell-Endpoint auf Atlas Cloud.
Content- und Business-Teams nutzen GLM-4.7, um aus strukturierten Prompts Word-Dokumente, PowerPoint-Präsentationen, PDFs und Excel-Berichte sowohl in Chinesisch als auch in Englisch zu erstellen. Mit 0,52 $ pro Million Input-Tokens ist es die kosteneffizienteste GLM-Stufe für hochvolumige Dokumenten-Workflows, die keine Argumentation auf Frontier-Niveau erfordern. Das Kontextfenster von 202K reicht aus, um vollständige Dokumentstrukturen und Quellmaterial in einem einzigen Aufruf zu erfassen.
KI-Infrastrukturteams nutzen GLM-5.1, um Benchmark-gesteuerte Optimierungspipelines für Machine-Learning-Workloads auszuführen. Bei Aufgaben im KernelBench-Stil führt GLM-5.1 Tausende von werkzeuggesteuerten Optimierungszyklen durch und erzielt eine 3,6-fache geometrische mittlere Beschleunigung. Die 8-stündige kontinuierliche Ausführungskapazität bedeutet, dass der Agent die vollständige Optimierungsschleife ausführt, ohne dass manuelle Neustarts zwischen den Sitzungen erforderlich sind.
Die Z.ai API bietet Entwicklern programmatischen Zugriff auf die GLM-Serie großer Sprachmodelle, die von Z.ai entwickelt wurden, dem Unternehmen, das auch als Zhipu AI bekannt ist. GLM steht für General Language Model und umfasst Versionen von GLM-4.6 bis zum Flaggschiff GLM-5.1, optimiert für Coding, agentische Workflows sowie den produktiven zweisprachigen Einsatz auf Chinesisch und Englisch. Auf Atlas Cloud erreichen Sie die gesamte Modellpalette über einen OpenAI-kompatiblen Endpoint.
Atlas Cloud hostet die GLM-Serie von GLM-4.6 bis zum Flaggschiff GLM-5.1, mit GLM-4.7 und GLM-5 dazwischen. Leichtere Tiers übernehmen alltägliche Aufgaben mit hohem Volumen zu geringeren Kosten, während GLM-5.1 auf die anspruchsvollsten Coding- und agentischen Aufgaben ausgerichtet ist. Jedes Modell läuft nutzungsbasiert über denselben Key.
Ja. Die offenen GLM-Gewichte, einschließlich GLM-5.1, werden unter der MIT-Lizenz veröffentlicht, die kommerzielle Nutzung, Fine-Tuning und Weiterverbreitung ohne Einschränkung erlaubt. Wenn Sie Infrastrukturaufwand lieber vermeiden möchten, stellt Atlas Cloud dieselben Modelle per API für verwalteten Zugriff bereit, statt dass Sie sie selbst hosten müssen.
Richten Sie Ihr bestehendes OpenAI SDK auf die Base URL von Atlas Cloud aus, setzen Sie Ihren Key und übergeben Sie den gewünschten GLM-Modellnamen. Da die Z.ai API OpenAI-kompatibel ist, migrieren die meisten Projekte, indem sie nur die Base URL und den Model String ändern, und die Modelle lassen sich direkt in Agent-Tools wie Claude Code, Cline und Roo Code integrieren. Legen Sie noch heute los.
Sowohl Chinesisch als auch Englisch sind für GLM erstklassig unterstützt; das Modell ist auf hohe Kompetenz in beiden Sprachen trainiert. Prompten Sie in einer der beiden Sprachen und erhalten Sie konsistent hohe Qualität zurück. Dadurch ist die Modellpalette praktisch für Teams, die chinesische und internationale Nutzer mit einem einzigen Modell bedienen möchten, statt separate Stacks zu pflegen.
GLM-4.6 bis GLM-5.1 unterstützen ein 200K token context window, genug, um große Codebases, lange Dokumente oder umfangreiche Agent-Traces in einer einzigen Anfrage zu verarbeiten. Wenn Ihr Workflow lange Ausgaben erzeugt, deckt dasselbe Fenster große Codedateien und mehrstufige Ausführungslogs ohne frühes Abschneiden ab.
GLM-5.1 führte SWE-Bench Pro im April 2026 mit einem Score von 58.4 an und gehört damit zu den stärksten Open-Source-Modellen für reales Coding. Es unterstützt außerdem kontinuierliche autonome Ausführung von bis zu acht Stunden für eine einzelne Aufgabe, mit Planung, Iteration und Lieferung in einer Schleife. Das eignet sich für langfristige Agent-Workflows in Umgebungen wie Claude Code.
Jedes GLM-Modell in der Z.ai API läuft mit transparenter nutzungsbasierter Preisgestaltung, abgerechnet pro Token ohne Abonnement oder monatliche Verpflichtung. Input- und Output-Token werden separat erfasst, und leichtere Tiers wie GLM-4.7 kosten pro Token weniger als das Flaggschiff GLM-5.1, sodass Sie die Modellwahl an Ihr Budget anpassen können. Prüfen Sie den aktuellen Preis pro Token auf der jeweiligen Model Card in Atlas Cloud.
Anleitungen, Tutorials und Produkt-Updates, mit denen Sie das Beste aus Atlas Cloud herausholen.