
A API da Z.ai leva toda a série GLM da ZhipuAI para a sua pilha tecnológica, do GLM-4.6 ao modelo principal GLM-5.1, que ocupa o primeiro lugar entre os modelos open-source no SWE-Bench Pro e executa agentes de programação autónomos durante horas seguidas. O GLM combina um contexto de 202K tokens com saída equilibrada em chinês e inglês sob uma licença MIT permissiva. O Atlas Cloud disponibiliza cada modelo através de uma única chave compatível com OpenAI, com acesso no Day-0 e preços transparentes por chamada. Comece hoje.
Impulsione chat, raciocínio e agentes em larga escala com os principais grandes modelos de linguagem, entregues de forma rápida e acessível na Atlas Cloud.
Compare standard vs. our pricing across every Z.ai model.
| Model | Standard Price (USD) | Our Price (USD) | Discount | |
|---|---|---|---|---|
| GLM 5.2 | $1.4/$4.4per 1M tokens1048.6K context | $1.26/$3.96M in/outper 1M tokens1048.6K context | -10% | View |
| GLM 5.1 | $1.4/$4.4per 1M tokens202.8K context | $1.26/$3.96M in/outper 1M tokens202.8K context | -10% | View |
| GLM 5v Turbo | $1.2/$4per 1M tokens202.8K context | $1.2/$4M in/outper 1M tokens202.8K context | — | View |
| GLM 5 | $1/$3.2per 1M tokens202.8K context | $0.95/$3.15M in/outper 1M tokens202.8K context | — | View |
| GLM 4.7 | $0.6/$2.2per 1M tokens202.8K context | $0.52/$1.85M in/outper 1M tokens202.8K context | — | View |
| GLM 4.6 | $0.6/$2.2per 1M tokens202.8K context | $0.6/$2.2M in/outper 1M tokens202.8K context | — | View |
Instantly explore and experiment with 400+ production-ready models in the Atlas Playground. Start customizing with one click.
Os níveis de modelo do GLM cobrem tudo, desde tarefas rápidas de chat bilíngue até agentes de codificação autônomos de várias horas. As equipes usam o GLM-5.1 para trabalhos de engenharia de longo prazo e o GLM-4.7 ou GLM-5 Turbo onde a eficiência de custos e a velocidade são prioridades.
Engineering teams use GLM-5.1 to run autonomous optimization agents that iterate on production systems over hundreds of rounds. In a documented run, GLM-5.1 improved a vector database through 600 iterations and 6,000 tool calls, reaching 21,500 queries per second — six times the result achievable in a single 50-turn session. Atlas Cloud's pay-as-you-go pricing makes it practical to run these extended sessions without pre-purchasing capacity.
As equipes de desenvolvimento usam o GLM-5.1 para executar transformações completas em bases de código durante sessões de várias horas sem pontos de verificação humanos. O modelo planeja, escreve, testa e itera as mudanças continuamente por até 8 horas, lidando com 655 iterações em uma demonstração de construção de um sistema Linux do zero. Isso substitui semanas de trabalho manual de refatoração em bases de código grandes e legadas.
As equipes de ferramentas para desenvolvedores integram o GLM-5.1 e o GLM-5 Turbo como o modelo subjacente para fluxos de trabalho de codificação de IA no Claude Code, Kilo Code, Cline, Roo Code e OpenCode. A Z-AI API na Atlas Cloud é compatível com a OpenAI, portanto, a troca da base URL é a única alteração necessária para rotear qualquer uma dessas ferramentas pelo GLM. A janela de contexto de 262K do GLM-5 Turbo o torna especialmente adequado para o contexto de arquivos grandes em fluxos de trabalho de IDE.
As equipes de operações constroem agentes de suporte usando GLM-5 que combinam acesso ao banco de dados de chamados, pesquisa na base de conhecimento e ferramentas de escalonamento para lidar com consultas repetitivas sem intervenção humana. A capacidade de chamada de múltiplas ferramentas e o suporte a streaming do modelo o tornam prático para implantações em tempo real voltadas para o cliente. O suporte bilíngue significa que o mesmo agente lida com chamados em chinês e inglês a partir de um único endpoint de modelo no Atlas Cloud.
As equipes de conteúdo e negócios usam o GLM-4.7 para gerar documentos do Word, apresentações do PowerPoint, PDFs e relatórios do Excel tanto em chinês quanto em inglês a partir de prompts estruturados. A US$ 0,52 por milhão de tokens de entrada, é o nível GLM mais econômico para fluxos de trabalho de documentos de alto volume que não exigem raciocínio de nível de fronteira. A janela de contexto de 202K é suficiente para conter esboços completos de documentos e material de origem em uma única chamada.
As equipes de infraestrutura de IA usam o GLM-5.1 para executar pipelines de otimização orientados por benchmarks em cargas de trabalho de aprendizado de máquina. Em tarefas no estilo KernelBench, o GLM-5.1 realiza milhares de ciclos de otimização orientados por ferramentas e alcança uma aceleração média geométrica de 3,6x. A capacidade de execução contínua de 8 horas significa que o agente executa o loop de otimização completo sem exigir reinicializações manuais entre as sessões.
A Z.ai API dá aos desenvolvedores acesso programático à série GLM de grandes modelos de linguagem criados pela Z.ai, a empresa também conhecida como Zhipu AI. GLM significa General Language Model e abrange versões de GLM-4.6 até o carro-chefe GLM-5.1, ajustadas para programação, fluxos de trabalho agênticos e uso em produção bilíngue em chinês e inglês. No Atlas Cloud, você acessa toda a linha por meio de um único endpoint compatível com OpenAI.
O Atlas Cloud hospeda a série GLM, de GLM-4.6 até o carro-chefe GLM-5.1, com GLM-4.7 e GLM-5 entre eles. Camadas mais leves lidam com tarefas cotidianas de alto volume a um custo menor, enquanto GLM-5.1 mira os trabalhos de programação e agênticos mais exigentes. Todos os modelos rodam em modalidade pay-as-you-go com a mesma chave.
Sim. Os pesos abertos de GLM, incluindo GLM-5.1, são lançados sob a licença MIT, que permite uso comercial, fine-tuning e redistribuição sem restrições. Se preferir evitar a sobrecarga de infraestrutura, o Atlas Cloud disponibiliza os mesmos modelos por API para acesso gerenciado em vez de self-hosting.
Aponte seu SDK OpenAI existente para a URL base do Atlas Cloud, configure sua chave e passe o nome do modelo GLM que deseja usar. Como a Z.ai API é compatível com OpenAI, a maioria dos projetos migra alterando apenas a URL base e a string do modelo, e os modelos se integram diretamente a ferramentas de agentes como Claude Code, Cline e Roo Code. Comece a criar hoje.
Tanto chinês quanto inglês são idiomas de primeira classe para GLM, que é treinado para ter forte proficiência em ambos. Escreva o prompt em qualquer um dos idiomas e você receberá qualidade consistente, o que torna a linha prática para equipes que atendem usuários chineses e internacionais com um único modelo, em vez de manter stacks separados.
De GLM-4.6 a GLM-5.1, os modelos oferecem suporte a uma janela de contexto de 200K tokens, suficiente para conter grandes codebases, documentos longos ou traces extensos de agentes em uma única requisição. Se o seu fluxo de trabalho gerar saídas longas, a mesma janela cobre arquivos de código grandes e logs de execução em várias etapas sem truncamento antecipado.
GLM-5.1 liderou o SWE-Bench Pro com uma pontuação de 58.4 em abril de 2026, colocando-o entre os modelos open-source mais fortes para programação no mundo real. Ele também oferece suporte à execução autônoma contínua por até oito horas em uma única tarefa, executando planejamento, iteração e entrega em um único loop, o que é adequado para fluxos de trabalho agênticos de longo horizonte em ambientes como Claude Code.
Todos os modelos GLM na Z.ai API usam preços transparentes em modalidade pay-as-you-go, cobrados por token, sem assinatura ou compromisso mensal. Tokens de entrada e saída são medidos separadamente, e camadas mais leves, como GLM-4.7, custam menos por token do que o carro-chefe GLM-5.1, para que você possa alinhar a escolha do modelo ao orçamento. Confira a tarifa atual por token no card de cada modelo no Atlas Cloud.
Guias, tutoriais e novidades de produto para você aproveitar ao máximo a Atlas Cloud.