Skip to main content
Geração de Texto

glm-5.2-fast-preview

O GLM-5.2-Fast-Preview é a variante de alta velocidade do GLM-5.2 da Zhipu AI, com contexto de 1M e capacidades equivalentes às da versão padrão. Otimizado para inferência, oferece 1,5 a 2 vezes mais TPS de saída e é ideal para casos de uso sensíveis à latência, como chat em tempo real, agentes de múltiplas interações e geração de código em streaming.

Provedor de service de inferência

O Alibaba Cloud Model Studio é o provedor de service de inferência para glm-5.2-fast-preview.

Capacidades do modelo

Capacidade

Suporte

Capacidade

Suporte

Modalidade de entrada

Text

Modalidade de saída

Text

Experiência do modelo

Unsupported

Function Calling

Supported

Saídas estruturadas

Supported

Busca na web

Supported

Conclusão de prefixo

Supported

Cache de contexto

Supported

Inferência em lote

Unsupported

Fine-tuning

Unsupported

Limites de contexto

Parâmetro

Valor

Parâmetro

Valor

Comprimento máximo de entrada

1.048.576

Comprimento máximo de saída

131.072

Janela de contexto

1.048.576

Comprimento máximo de entrada (Thinking Mode)

1.048.576

Comprimento máximo de saída (Thinking Mode)

131.072

Preços

Esta página exibe apenas os preços originais das chamadas de API do modelo, sem incluir promoções por tempo limitado. Acesse o Model Studio Console para visualizar ofertas promocionais.
  • China (Beijing)
  • Singapore

Item de faturamento

Preço (USD)

Unidade

Entrada

2,2

Por 1M tokens

Saída

7.702

Por 1M tokens

Entrada (Cache implícito)

0,55

Por 1M tokens

Limites de taxa

  • China (Beijing)
  • Singapore

Parâmetro

Valor

RPM (Requisições por minuto)

30.000

TPM (Tokens por minuto)

1.000.000

Versões de snapshot

glm-5.2-fast-preview

O GLM-5.2-Fast-Preview é a variante de alta velocidade do GLM-5.2 da Zhipu AI, com contexto de 1M e capacidades equivalentes às da versão padrão. Otimizado para inferência, oferece 1,5 a 2 vezes mais TPS de saída e é ideal para casos de uso sensíveis à latência, como chat em tempo real, agentes de múltiplas interações e geração de código em streaming.

Provedor de service de inferência

O Alibaba Cloud Model Studio é o provedor de service de inferência para glm-5.2-fast-preview.

Capacidades do modelo

Capacidade

Suporte

Capacidade

Suporte

Modalidade de entrada

Text

Modalidade de saída

Text

Experiência do modelo

Unsupported

Function Calling

Supported

Saídas estruturadas

Supported

Busca na web

Supported

Conclusão de prefixo

Supported

Cache de contexto

Supported

Inferência em lote

Unsupported

Fine-tuning

Unsupported

Limites de contexto

Parâmetro

Valor

Parâmetro

Valor

Comprimento máximo de entrada

1.048.576

Comprimento máximo de saída

131.072

Janela de contexto

1.048.576

Comprimento máximo de entrada (Thinking Mode)

1.048.576

Comprimento máximo de saída (Thinking Mode)

131.072

Preços

Esta página exibe apenas os preços originais das chamadas de API do modelo, sem incluir promoções por tempo limitado. Acesse o Model Studio Console para visualizar ofertas promocionais.
  • China (Beijing)
  • Singapore

Item de faturamento

Preço (USD)

Unidade

Entrada

2,2

Por 1M tokens

Saída

7.702

Por 1M tokens

Entrada (Cache implícito)

0,55

Por 1M tokens

Limites de taxa

  • China (Beijing)
  • Singapore

Parâmetro

Valor

RPM (Requisições por minuto)

30.000

TPM (Tokens por minuto)

1.000.000

Plano de Tokens
Playground de Modelos
  • Music generation
Inferência do Modelo
Avaliação
Compressão de Modelos
Estatísticas e Monitoramento