Skip to main content
Inferência do Modelo

Fast mode

O modo Fast oferece TPS mais alto para cenários sensíveis à latência.

Uso

O modo Fast oferece os seguintes recursos principais:
  • Saída de alta velocidade: o TPS aumenta para 1,5 a 2 vezes o valor da API padrão. Esse recurso é ideal para assistentes de codificação com IA, raciocínio de Agent em múltiplas etapas, conversas em tempo real e outros cenários sensíveis à latência.
  • Faturamento baseado em tokens: a lógica de faturamento segue a mesma da API padrão, com cobrança baseada nos tokens de entrada e saída.
  • Limitação de taxa especial: quando o volume de chamadas atinge o limite de taxa, se a plataforma ainda tiver recursos disponíveis, o limite não será acionado. Assim, o TPS realmente disponível nunca fica abaixo do limite estabelecido.
Para ativar o modo Fast, defina o parâmetro do modelo como o ID do modelo em Supported models. Nenhum parâmetro adicional é necessário. O endpoint segue o formato https://{workspace_id}.cn-beijing.maas.aliyuncs.com/compatible-mode/v1, onde você encontra o {workspace_id} na página Business Space Management após alternar para a região correspondente. Exemplo básico de chamada:
O nome do modelo para o modo prime do glm 5,2 continua sendo glm-5.2-fast-preview.
curl -X POST https://{workspace_id}.cn-beijing.maas.aliyuncs.com/compatible-mode/v1/chat/completions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.2-fast-preview",
    "messages": [{"role": "user", "content": "Who are you"}],
    "stream": false
}'

Modelos compatíveis

  • China (Beijing)
  • Singapore

Modelo de geração de texto

Preços (por milhão de tokens)

Preço unitário de entrada

Preço unitário de saída

Cache hit

glm-5.2-fast-preview

$2.200

$7.702

$0.550

Modelo de geração de vídeo

Preços ($/segundo)

480P

720P

1080P

wan3.0-video-prime

$0,068/segundo

$0,14/segundo

$0,28/segundo

Exemplos

Por padrão, o modelo glm-5,2 retorna um campo reasoning_content para raciocínio. Durante o streaming, o conteúdo de raciocínio e o conteúdo da resposta são entregues por meio de delta.reasoning_content e delta.content, respectivamente. Exemplo de chamada com streaming:
from openai import OpenAI
import os

client = OpenAI(
    api_key=os.environ.get("API_KEY"),
    base_url=os.environ.get("BASE_URL"),
)

completion = client.chat.completions.create(
    model="glm-5.2-fast-preview",
    messages=[{"role": "user", "content": "Who are you"}],
    stream=True,
)

for chunk in completion:
    if not chunk.choices:
        continue
    delta = chunk.choices[0].delta
    if hasattr(delta, "reasoning_content") and delta.reasoning_content:
        print(delta.reasoning_content, end="", flush=True)
    if hasattr(delta, "content") and delta.content:
        print(delta.content, end="", flush=True)
Exemplo de resposta:
{
  "id": "chatcmpl-xxx",
  "object": "chat.completion",
  "model": "glm-5.2-fast-preview",
  "choices": [{
    "index": 0,
    "message": {
      "role": "assistant",
      "reasoning_content": "...",
      "content": "..."
    },
    "finish_reason": "stop"
  }],
  "usage": {
    "prompt_tokens": 14,
    "completion_tokens": 137,
    "total_tokens": 151,
    "prompt_tokens_details": { "cached_tokens": 0 },
    "completion_tokens_details": { "reasoning_tokens": 127 }
  }
}

Faturamento

Para obter as regras de faturamento e os preços do modo Fast, consulte Model inference pricing.

Códigos de erro

Para verificar os códigos de erro que podem ocorrer ao chamar o modo Fast e as respectivas soluções, consulte Error codes.
Plano de Tokens
Playground de Modelos
  • Music generation
Inferência do Modelo
Avaliação
Compressão de Modelos
Estatísticas e Monitoramento
Suporte