Este documento descreve como chamar o service de inferência do modelo ZHIPUZ.AI no Alibaba Cloud Model Studio.
Ativação do service
- Acesse o console do Model Studio, pesquise por ZHIPU/GLM, localize o cartão do modelo de texto da série GLM Z.AI e clique em Activate Now.
- Na caixa de diálogo, confirme a ativação e a autorização.
Início rápido
O ZHIPU/GLM-5.3 é o modelo mais recente da série GLM e suporta contexto de 1M. Execute o código a seguir para chamar rapidamente o modelo ZHIPU/GLM-5.3 no modo de raciocínio.
Você precisa ter obtained an API Key e configured the API Key as an environment variable. Se for chamar o modelo usando um SDK, também é necessário instale o SDK.
- Compatibilidade com OpenAI
enable_thinking não é um parâmetro padrão da OpenAI. No SDK Python da OpenAI, passe-o em extra_body. No SDK Node.js, passe-o como um parâmetro de nível superior.- Python
- Node.js
- HTTP
Código de exemplo
Resposta
Chamada de ferramenta em streaming
Os modelos ZHIPU/GLM-5.3, ZHIPU/GLM-5.2, suportam o parâmetro tool_stream. Esse parâmetro é booleano, tem como valor padrão false e funciona apenas quando stream é true. Quando ativado, os arguments do parâmetro tool_call do Function calling são retornados incrementalmente como um fluxo.
Os parâmetros stream e tool_stream funcionam em conjunto da seguinte forma:
stream | tool_stream | Comotool_callé retornado |
|---|---|---|
true | true | Os |
true | false (padrão) | Os |
false | true/false | O parâmetro |
- Compatível com OpenAI
- Python
- Node.js
- curl
Código de exemplo
Controle de raciocínio (thinking.type e reasoning_effort)
O ZHIPU/GLM-5.3 sempre opera no modo de raciocínio e não suporta a desativação dessa funcionalidade. Mantenha thinking.type definido como enabled (ou mantenha enable_thinking definido como true) e use reasoning_effort para controlar a profundidade do raciocínio.
Parâmetro | Descrição | Valores suportados |
|---|---|---|
| Controla se o raciocínio está ativado. O valor padrão é |
|
| Controla a profundidade do raciocínio do modelo. Se este parâmetro não for especificado, o valor padrão será |
|
Limpar raciocínio histórico (clear_thinking)
O parâmetro clear_thinking controla se o reasoning_content (processo de raciocínio) de turnos anteriores é passado ao modelo como contexto em conversas de múltiplos turnos. Apenas os modelos da série GLM suportam este parâmetro.
true: Ignora oreasoning_contentde turnos anteriores e usa apenas conteúdo sem raciocínio, como texto visível, chamadas de ferramentas e resultados de ferramentas, como contexto. Isso reduz o comprimento do contexto e o custo.false(padrão): Retém oreasoning_contentde turnos anteriores e o fornece ao modelo junto com o contexto. Para ative o Raciocínio Preservado, você deve passar oreasoning_contenthistórico nas mensagens de forma completa, sem modificações e em sua ordem original. Omitir, truncar, reescrever ou reordenar esse conteúdo degrada o efeito ou impede que ele funcione.
assistant carregam reasoning_content. Quando clear_thinking=true, o conteúdo de raciocínio histórico não é contabilizado no contexto, então prompt_tokens é menor do que com false (o padrão). O valor real depende do comprimento do reasoning_content histórico.
- Compatível com OpenAI
Outros recursos
| Modelo | Multi-turn conversation | Function calling | Structured output | Internet search | Prefix completion | Context caching | Controle de esforço de raciocínio |
|---|---|---|---|---|---|---|---|
| ZHIPU/GLM-5.3 | Suportado | Suportado | Suportado | Não suportado | Suportado | Suportado | Suportadoreasoning_effort |
| ZHIPU/GLM-5.2 | Suportado | Suportado | SuportadoApenas modo sem raciocínio | Não suportado | Suportado | Suportado | Suportadoreasoning_effort |
- O número mínimo de tokens em cache é 512, comparado a 256 no Model Studio.
Valores padrão dos parâmetros
Modelo | enable_thinking | temperature | top_p | top_k | repetition_penalty |
|---|---|---|---|---|---|
ZHIPU/GLM-5.3 | true (não pode ser desativado) | 1,0 | 0,95 | - | - |
ZHIPU/GLM-5.2 | true | 1,0 | 0,95 | - | - |
Lista de modelos e faturamento
Os modelos da série GLM são modelos de raciocínio híbrido da Z.AI. Eles foram projetados para agentes inteligentes e oferecem dois modos: com raciocínio e sem raciocínio. O ZHIPU/GLM-5.3 suporta apenas o modo com raciocínio.
Para obter informações sobre o comprimento do contexto do modelo e preços, consulte o console do Model Studioconsole do Model Studio.
O faturamento é baseado nos tokens de entrada e saída do modelo.
No modo de raciocínio, a cadeia de pensamento é faturada com base nos tokens de saída.
Códigos de erro
Se ocorrer um erro, consulte Error codes para resolver o problema.
A seguir estão os códigos de erro de service exclusivos da Z.AI. Os códigos de erro HTTP são os mesmos que os códigos de erro gerais do Model Studio. Consulte o link acima.
Categoria do erro | Código do erro | Mensagem de erro |
|---|---|---|
Erro básico | 500 | Erro interno |
Erro de autenticação | 1000 | Falha na autenticação |
1001 | O parâmetro de Autenticação não foi recebido no cabeçalho. A autenticação não pode ser realizada. | |
1002 | O Token de Autenticação é inválido. Certifique-se de que o Token de Autenticação foi passado corretamente. | |
1003 | O Token de Autenticação expirou. Regenere ou obtenha um novo. | |
1004 | Falha na verificação do Token de Autenticação. | |
1100 | Leitura/gravação de conta | |
Erro de conta | 1110 | Sua conta está inativa. Verifique as informações da sua conta. |
1111 | Sua conta não existe. | |
1112 | Sua conta está bloqueada. Entre em contato com o suporte ao cliente para desbloqueá-la. | |
1113 | Sua conta possui saldo pendente. Recarregue sua conta e tente novamente. | |
1120 | Não é possível acessar sua conta. Tente novamente mais tarde. | |
1121 | Conta bloqueada devido a violação de política. | |
Erro de chamada de API | 1200 | Erro de chamada de API |
1210 | Parâmetros de chamada de API inválidos. Verifique a documentação. | |
1211 | O modelo não existe. Verifique o código do modelo. | |
1212 | O modelo atual não suporta o método de chamada | |
1213 | O parâmetro | |
1214 | O parâmetro | |
1215 |
| |
1220 | Você não tem permissão para acessar | |
1221 | A API | |
1222 | A API | |
1230 | Erro no processo de chamada da API. | |
1231 | Você já possui uma solicitação: | |
1234 | Erro de rede. ID do erro: | |
1261 | O prompt é muito longo. | |
Erro de bloqueio por política da API | 1300 | A chamada da API foi bloqueada por uma política. |
1301 | O sistema detectou conteúdo potencialmente inseguro ou sensível na entrada ou saída. Evite usar prompts que possam gerar conteúdo sensível. Obrigado pela cooperação. | |
1302 | A concorrência para esta API está muito alta. Reduza a concorrência ou entre em contato com o suporte ao cliente para aumentar o limite. | |
1303 | A taxa de solicitação para esta API está muito alta. Reduza a taxa de solicitação ou entre em contato com o suporte ao cliente para aumentar o limite. | |
1304 | O limite diário de chamadas para esta API foi atingido. Para aumentar o limite, entre em contato com o suporte ao cliente. | |
1305 | O limite de tráfego para esta API foi atingido. | |
1308 | O limite de uso de | |
1309 | Seu GLM Coding Plan expirou e está indisponível. Para restaurar o service, renove seu plano em https://bigmodel.cn/claude-code. | |
1310 | O limite de uso semanal/mensal foi atingido. Seu limite será redefinido em | |
1311 | Seu plano de assinatura atual não inclui acesso a | |
1312 | Este modelo está enfrentando alto tráfego. Tente novamente mais tarde ou mude para outro modelo, como | |
1313 | O uso da sua conta viola a política de uso justo e sua taxa de solicitação foi limitada. Para mais informações, consulte os "Termos e Acordos - Acordo de Assinatura e Renovação Automática". Para restaurar o acesso total, acesse Personal Center > Programming Plan Overview e solicite a remoção da restrição. |