
L'API Z.ai porta l'intera serie GLM di ZhipuAI nel tuo stack, da GLM-4.6 al modello di punta GLM-5.1, che si classifica al primo posto tra i modelli open-source su SWE-Bench Pro ed esegue agenti di coding autonomi per ore consecutive. GLM combina un contesto da 202K token con output bilanciato in cinese e inglese, sotto una licenza permissiva MIT. Atlas Cloud distribuisce ogni modello tramite un'unica chiave compatibile con OpenAI, con accesso Day-0 e prezzi trasparenti per chiamata. Inizia oggi.
Alimenta chat, ragionamento e agenti su larga scala con i migliori modelli linguistici di grandi dimensioni, erogati in modo rapido ed economico su Atlas Cloud.
Compare standard vs. our pricing across every Z.ai model.
| Model | Standard Price (USD) | Our Price (USD) | Discount | |
|---|---|---|---|---|
| GLM 5.2 | $1.4/$4.4per 1M tokens1048.6K context | $1.26/$3.96M in/outper 1M tokens1048.6K context | -10% | View |
| GLM 5.1 | $1.4/$4.4per 1M tokens202.8K context | $1.26/$3.96M in/outper 1M tokens202.8K context | -10% | View |
| GLM 5v Turbo | $1.2/$4per 1M tokens202.8K context | $1.2/$4M in/outper 1M tokens202.8K context | — | View |
| GLM 5 | $1/$3.2per 1M tokens202.8K context | $0.95/$3.15M in/outper 1M tokens202.8K context | — | View |
| GLM 4.7 | $0.6/$2.2per 1M tokens202.8K context | $0.52/$1.85M in/outper 1M tokens202.8K context | — | View |
| GLM 4.6 | $0.6/$2.2per 1M tokens202.8K context | $0.6/$2.2M in/outper 1M tokens202.8K context | — | View |
Instantly explore and experiment with 400+ production-ready models in the Atlas Playground. Start customizing with one click.
I livelli dei modelli di GLM coprono tutto, dalle rapide attività di chat bilingue agli agenti di codifica autonomi di diverse ore. I team utilizzano GLM-5.1 per lavori di ingegneria a lungo termine e GLM-4.7 o GLM-5 Turbo quando l'efficienza dei costi e la velocità sono prioritarie.
Engineering teams use GLM-5.1 to run autonomous optimization agents that iterate on production systems over hundreds of rounds. In a documented run, GLM-5.1 improved a vector database through 600 iterations and 6,000 tool calls, reaching 21,500 queries per second — six times the result achievable in a single 50-turn session. Atlas Cloud's pay-as-you-go pricing makes it practical to run these extended sessions without pre-purchasing capacity.
I team di sviluppo utilizzano GLM-5.1 per eseguire trasformazioni complete delle codebase in sessioni di diverse ore senza checkpoint umani. Il modello pianifica, scrive, testa e itera le modifiche continuamente fino a 8 ore, gestendo 655 iterazioni in una dimostrazione di costruzione di un sistema Linux da zero. Questo sostituisce settimane di lavoro di refactoring manuale su codebase grandi e legacy.
I team di strumenti per sviluppatori integrano GLM-5.1 e GLM-5 Turbo come modello sottostante per i flussi di lavoro di codifica basati sull'IA in Claude Code, Kilo Code, Cline, Roo Code e OpenCode. La Z-AI API su Atlas Cloud è compatibile con OpenAI, quindi la sostituzione della base URL è l'unica modifica necessaria per indirizzare uno qualsiasi di questi strumenti tramite GLM. La finestra di contesto da 262K di GLM-5 Turbo lo rende particolarmente adatto per il contesto di file di grandi dimensioni nei flussi di lavoro degli IDE.
I team operativi creano agenti di supporto utilizzando GLM-5 che combinano l'accesso al database dei ticket, la ricerca nella knowledge base e gli strumenti di escalation per gestire query ripetitive senza intervento umano. Le funzionalità di chiamata multi-strumento e il supporto streaming del modello lo rendono pratico per le implementazioni in tempo reale rivolte ai clienti. Il supporto bilingue significa che lo stesso agente gestisce i ticket in cinese e inglese da un singolo endpoint del modello su Atlas Cloud.
I team di contenuti e aziendali utilizzano GLM-4.7 per generare documenti Word, presentazioni PowerPoint, PDF e report Excel sia in cinese che in inglese a partire da prompt strutturati. A 0,52 $ per milione di token di input, è il livello GLM più conveniente per flussi di lavoro di documenti ad alto volume che non richiedono ragionamenti di livello frontier. La finestra di contesto di 202K è sufficiente per contenere schemi di documenti completi e materiale sorgente in una singola chiamata.
I team di infrastruttura IA utilizzano GLM-5.1 per eseguire pipeline di ottimizzazione guidate da benchmark su carichi di lavoro di machine learning. Su attività in stile KernelBench, GLM-5.1 esegue migliaia di cicli di ottimizzazione guidati da strumenti e ottiene un'accelerazione media geometrica di 3,6x. La capacità di esecuzione continua di 8 ore significa che l'agente esegue l'intero ciclo di ottimizzazione senza richiedere riavvii manuali tra una sessione e l'altra.
L'API Z.ai offre agli sviluppatori accesso programmatico alla serie GLM di large language model realizzati da Z.ai, l'azienda nota anche come Zhipu AI. GLM sta per General Language Model e comprende release da GLM-4.6 al flagship GLM-5.1, ottimizzate per coding, workflow agentici e uso in produzione bilingue in cinese e inglese. Su Atlas Cloud puoi accedere all'intera gamma tramite un unico endpoint compatibile con OpenAI.
Atlas Cloud ospita la serie GLM da GLM-4.6 fino al flagship GLM-5.1, con GLM-4.7 e GLM-5 intermedi. I tier più leggeri gestiscono attività quotidiane ad alto volume a un costo inferiore, mentre GLM-5.1 è pensato per i lavori di coding e agentici più impegnativi. Ogni modello funziona in modalità pay-as-you-go tramite la stessa chiave.
Sì. Gli open weights di GLM, incluso GLM-5.1, sono rilasciati con licenza MIT, che consente uso commerciale, fine-tuning e redistribuzione senza restrizioni. Se preferisci evitare l'onere dell'infrastruttura, Atlas Cloud serve gli stessi modelli via API per un accesso gestito invece del self-hosting.
Punta il tuo SDK OpenAI esistente alla base URL di Atlas Cloud, imposta la tua chiave e passa il nome del modello GLM che vuoi usare. Poiché l'API Z.ai è compatibile con OpenAI, la maggior parte dei progetti migra cambiando solo la base URL e la stringa del modello; i modelli si integrano direttamente con strumenti agentici come Claude Code, Cline e Roo Code. Inizia a sviluppare oggi stesso.
Sia il cinese sia l'inglese sono lingue di prima classe per GLM, addestrato per offrire un'elevata competenza in entrambe. Puoi scrivere prompt in una delle due lingue e ottenere una qualità costante, rendendo la gamma pratica per team che servono utenti cinesi e internazionali con un unico modello invece di mantenere stack separati.
Da GLM-4.6 a GLM-5.1 supportano una finestra di contesto da 200K token, sufficiente per contenere grandi codebase, documenti lunghi o tracce agentiche estese in una singola richiesta. Se il tuo workflow produce output lunghi, la stessa finestra copre file di codice di grandi dimensioni e log di esecuzione multi-step senza troncamenti prematuri.
GLM-5.1 ha raggiunto il primo posto in SWE-Bench Pro con un punteggio di 58.4 ad aprile 2026, collocandosi tra i modelli open-source più forti per il coding nel mondo reale. Supporta inoltre l'esecuzione autonoma continua fino a otto ore su un singolo task, gestendo pianificazione, iterazione e consegna in un unico ciclo: una caratteristica adatta a workflow agentici di lungo orizzonte in ambienti come Claude Code.
Ogni modello GLM sull'API Z.ai usa una tariffazione pay-as-you-go trasparente, fatturata per token senza abbonamento né impegno mensile. I token di input e output sono misurati separatamente, e i tier più leggeri come GLM-4.7 costano meno per token rispetto al flagship GLM-5.1, così puoi adattare la scelta del modello al budget. Controlla la tariffa per token aggiornata nella scheda di ciascun modello su Atlas Cloud.
Guide, tutorial e novità di prodotto per sfruttare al meglio Atlas Cloud.