O GLM-5.2-Fast-Preview é a variante de alta velocidade do GLM-5.2 da Zhipu AI, com contexto de 1M e capacidades equivalentes às da versão padrão. Otimizado para inferência, oferece 1,5 a 2 vezes mais TPS de saída e é ideal para casos de uso sensíveis à latência, como chat em tempo real, agentes de múltiplas interações e geração de código em streaming.
Provedor de service de inferência
O Alibaba Cloud Model Studio é o provedor de service de inferência para glm-5.2-fast-preview.
Capacidades do modelo
Capacidade | Suporte | Capacidade | Suporte |
Modalidade de entrada | Text | Modalidade de saída | Text |
Experiência do modelo | Unsupported | Function Calling | Supported |
Saídas estruturadas | Supported | Busca na web | Supported |
Conclusão de prefixo | Supported | Cache de contexto | Supported |
Inferência em lote | Unsupported | Fine-tuning | Unsupported |
Limites de contexto
Parâmetro | Valor | Parâmetro | Valor |
Comprimento máximo de entrada | 1.048.576 | Comprimento máximo de saída | 131.072 |
Janela de contexto | 1.048.576 | Comprimento máximo de entrada (Thinking Mode) | 1.048.576 |
Comprimento máximo de saída (Thinking Mode) | 131.072 |
Preços
Esta página exibe apenas os preços originais das chamadas de API do modelo, sem incluir promoções por tempo limitado. Acesse o Model Studio Console para visualizar ofertas promocionais.
- China (Beijing)
- Singapore
Item de faturamento | Preço (USD) | Unidade |
Entrada | 2,2 | Por 1M tokens |
Saída | 7.702 | Por 1M tokens |
Entrada (Cache implícito) | 0,55 | Por 1M tokens |
Limites de taxa
- China (Beijing)
- Singapore
Parâmetro | Valor |
RPM (Requisições por minuto) | 30.000 |
TPM (Tokens por minuto) | 1.000.000 |
Versões de snapshot
glm-5.2-fast-preview
O GLM-5.2-Fast-Preview é a variante de alta velocidade do GLM-5.2 da Zhipu AI, com contexto de 1M e capacidades equivalentes às da versão padrão. Otimizado para inferência, oferece 1,5 a 2 vezes mais TPS de saída e é ideal para casos de uso sensíveis à latência, como chat em tempo real, agentes de múltiplas interações e geração de código em streaming.
Provedor de service de inferência
O Alibaba Cloud Model Studio é o provedor de service de inferência para glm-5.2-fast-preview.
Capacidades do modelo
Capacidade | Suporte | Capacidade | Suporte |
Modalidade de entrada | Text | Modalidade de saída | Text |
Experiência do modelo | Unsupported | Function Calling | Supported |
Saídas estruturadas | Supported | Busca na web | Supported |
Conclusão de prefixo | Supported | Cache de contexto | Supported |
Inferência em lote | Unsupported | Fine-tuning | Unsupported |
Limites de contexto
Parâmetro | Valor | Parâmetro | Valor |
Comprimento máximo de entrada | 1.048.576 | Comprimento máximo de saída | 131.072 |
Janela de contexto | 1.048.576 | Comprimento máximo de entrada (Thinking Mode) | 1.048.576 |
Comprimento máximo de saída (Thinking Mode) | 131.072 |
Preços
Esta página exibe apenas os preços originais das chamadas de API do modelo, sem incluir promoções por tempo limitado. Acesse o Model Studio Console para visualizar ofertas promocionais.
- China (Beijing)
- Singapore
Item de faturamento | Preço (USD) | Unidade |
Entrada | 2,2 | Por 1M tokens |
Saída | 7.702 | Por 1M tokens |
Entrada (Cache implícito) | 0,55 | Por 1M tokens |
Limites de taxa
- China (Beijing)
- Singapore
Parâmetro | Valor |
RPM (Requisições por minuto) | 30.000 |
TPM (Tokens por minuto) | 1.000.000 |