Skip to main content
Geração de Texto

glm-5.1

O GLM-5.1 é um modelo desenvolvido pela Zhipu AI, projetado especificamente para tarefas de longo horizonte. Com 744 bilhões de parâmetros, ele suporta contexto ultra-longo de 200 mil tokens e gera até 128 mil tokens em uma única resposta. O modelo se destaca em raciocínio lógico, compreensão de textos longos e geração de código, equilibrando desempenho e eficiência de inferência. Apresenta resultados excelentes em diversos benchmarks multitarefa, sendo ideal para interação homem-máquina inteligente, soluções corporativas e assistência a desenvolvedores.

Provedor do service de inferência

O Alibaba Cloud Model Studio fornece o service de inferência para glm-5.1.

Capacidades do modelo

Capacidade

Suporte

Capacidade

Suporte

Modalidade de entrada

Text

Modalidade de saída

Text

Experiência do modelo

Supported

Function Calling

Supported

Saídas estruturadas

Supported

Pesquisa na web

Unsupported

Conclusão de prefixo

Unsupported

Cache de contexto

Supported

Inferência em lote

Unsupported

Fine-tuning

Unsupported

Limites de contexto

Parâmetro

Valor

Parâmetro

Valor

Comprimento máximo de entrada

202.745

Comprimento máximo de saída

131.072

Janela de contexto

202.745

Comprimento máximo de entrada (Modo de Pensamento)

169.984

Comprimento máximo de saída (Modo de Pensamento)

131.072

Preços

Esta página exibe apenas os preços originais das chamadas de API do modelo, sem incluir promoções por tempo limitado. Acesse o Model Studio Console para consultar ofertas promocionais.
  • China (Beijing)
  • Singapore
  • Germany (Frankfurt)
  • US (Virginia)
  • Japan (Tokyo)

Item de faturamento

Preço (USD)

Unidade

Entrada

0,825

Por 1M tokens

Saída

3,301

Por 1M tokens

Entrada (Cache Implícito)

0,165

Por 1M tokens

Criação de Cache Explícito

1,031

Por 1M tokens

Leitura de Cache Explícito

0,083

Por 1M tokens

Item de faturamento

Preço (USD)

Unidade

Entrada

1,1

Por 1M tokens

Saída

3,851

Por 1M tokens

Entrada (Cache Implícito)

0,22

Por 1M tokens

Criação de Cache Explícito

1,375

Por 1M tokens

Leitura de Cache Explícito

0,11

Por 1M tokens

Limites de taxa

  • China (Beijing)
  • Singapore
  • Germany (Frankfurt)
  • US (Virginia)
  • Japan (Tokyo)

Parâmetro

Valor

RPM (Requisições por Minuto)

500

TPM (Tokens por Minuto)

1.000.000

Plano de Tokens
Playground de Modelos
  • Music generation
Inferência do Modelo
Avaliação
Compressão de Modelos
Estatísticas e Monitoramento