O modo Fast oferece TPS mais alto para cenários sensíveis à latência.
Uso
O modo Fast oferece os seguintes recursos principais:
- Saída de alta velocidade: o TPS aumenta para 1,5 a 2 vezes o valor da API padrão. Esse recurso é ideal para assistentes de codificação com IA, raciocínio de Agent em múltiplas etapas, conversas em tempo real e outros cenários sensíveis à latência.
- Faturamento baseado em tokens: a lógica de faturamento segue a mesma da API padrão, com cobrança baseada nos tokens de entrada e saída.
- Limitação de taxa especial: quando o volume de chamadas atinge o limite de taxa, se a plataforma ainda tiver recursos disponíveis, o limite não será acionado. Assim, o TPS realmente disponível nunca fica abaixo do limite estabelecido.
https://{workspace_id}.cn-beijing.maas.aliyuncs.com/compatible-mode/v1, onde você encontra o {workspace_id} na página Business Space Management após alternar para a região correspondente.
Exemplo básico de chamada:
O nome do modelo para o modo prime do glm 5,2 continua sendo glm-5.2-fast-preview.
Modelos compatíveis
- China (Beijing)
- Singapore
Modelo de geração de texto | Preços (por milhão de tokens) | ||
|---|---|---|---|
Preço unitário de entrada | Preço unitário de saída | Cache hit | |
glm-5.2-fast-preview | $2.200 | $7.702 | $0.550 |
Modelo de geração de vídeo | Preços ($/segundo) | ||
480P | 720P | 1080P | |
wan3.0-video-prime | $0,068/segundo | $0,14/segundo | $0,28/segundo |
Exemplos
Por padrão, o modelo glm-5,2 retorna um campo reasoning_content para raciocínio. Durante o streaming, o conteúdo de raciocínio e o conteúdo da resposta são entregues por meio de delta.reasoning_content e delta.content, respectivamente. Exemplo de chamada com streaming: