Skip to main content
Implantação

Visão geral da implantação dedicada

Seja utilizando os modelos pré-configurados da plataforma ou seus próprios modelos ajustados finamente, a implantação permite obter um service de inferência independente e com recursos dedicados. Essa abordagem atende às necessidades do seu negócio em diferentes níveis de desempenho, como alta concorrência e baixa latência.

Independentemente de usar os modelos pré-configurados da plataforma ou os modelos que você fine-tuned ,

Métodos de faturamento

Antes da implantação, consulte o custo horário estimado dos diferentes modelos no console de Model Deployment .
Não é possível alterar o método de faturamento após a criação do service. Para mudar o método, coloque o modelo implantado offline e implante-o novamente.

Provisioned Throughput (PTU, Provisioned Throughput Unit)

(Alto throughput; alto desempenho)

Model Unit

(Métricas de desempenho personalizadas; isolamento de recursos)

Uso baseado em Tokens

(Pagamento conforme o uso após ajuste fino/validação de efeito)

Definição

Método de implantação de modelos que reserva recursos da plataforma para garantir uma capacidade específica de throughput de TPM; sem limitação de taxa dentro da cota garantida.

Método de implantação de modelos que configura o poder computacional com base na duração de uso e na quantidade de Model Units, oferecendo recursos dedicados.

Método de implantação de modelos que utiliza os Tokens de entrada e os Tokens de saída gerados por chamada como base para medição de uso.

Vantagens

  1. Oferece capacidade de throughput estável, menor latência e maior previsibilidade de recursos para ambientes de produção com alta carga.

  2. Em comparação ao faturamento baseado em Tokens, o TPS (Tokens gerados por segundo) geralmente aumenta entre 1,5 e 2,0 vezes.

  3. Permite configurar a renovação automática.

  1. Possibilita personalizar métricas de desempenho, como latência e throughput.

  2. Permite configurar a renovação automática.

Sem cobrança quando não estiver em uso.

Modelos suportados

Alguns modelos pré-configurados

Alguns modelos pré-configurados e todos os modelos ajustados finamente

Alguns modelos ajustados finamente com LoRA

Casos de uso

  1. Atendimento ao cliente inteligente para aplicativos bancários (tráfego estável, exige garantia de experiência simultânea).

  2. Moderação de conteúdo em tempo real para plataformas sociais (requer processamento estável de tarefas previsíveis em pipeline).

  3. API de tradução em cloud pública (fornece garantias de service básico para usuários de pacotes padrão).

  1. Grandes modelos exclusivos ajustados finamente para e-commerce (implantação de modelos privados com dimensionamento manual durante grandes promoções).

  2. Modelos de triagem molecular para empresas farmacêuticas (exigem recursos dedicados para tarefas de longa duração).

  3. Simulação de direção autônoma (necessita de computação contínua por longos períodos).

Validação de efeito de modelo ajustado finamente

Diagrama de faturamento

image

image

image

Método de faturamento

Por duração de uso e throughput provisionado

Pagamento conforme o uso, pacote diário

Por duração de uso e quantidade de Model Units

Pagamento conforme o uso, pacote mensal

Por uso de Tokens do modelo

Pagamento conforme o uso

Método de dimensionamento

Aumento/diminuição self-service do throughput

Aumento/diminuição self-service de Model Units

Envie uma solicitação no console e aguarde a revisão manual.

Restrições do product

  1. Faturamento pré-pago diariamente. Não há reembolso antecipado disponível.

  2. Se o uso dentro de uma unidade de tempo exceder o throughput adquirido, o sistema aplicará a estratégia de estouro selecionada na criação: o estouro automático muda para o faturamento de pagamento conforme o uso de model invocation para esse modelo, enquanto a opção de usar apenas a capacidade PTU retorna o erro 429.

Após uma compra pré-paga, se você cancelar antecipadamente dentro do primeiro mês, o preço unitário diário (≈ preço unitário mensal / 30) será cobrado multiplicado por 1,2

  1. Suporta apenas alguns modelos após ajuste fino eficiente (LoRA).

  2. Será liberado automaticamente se não for utilizado dentro de um mês.

Para visualizar as estatísticas históricas de uso de Tokens e contagem de chamadas para cada solicitação, acesse: Monitoramento de Modelos.

Detalhes de faturamento

  • Tab
  • Faturamento por duração de uso (Model Unit)
  • Por uso de tokens do modelo

Singapore

  • Qwen
  • DeepSeek
  • Qwen-VL
  • GLM

Nome do modelo

Código do modelo

Máximo de tokens de entrada

Entrada pós-paga

Por 10K TPM/Hora

Saída pós-paga

Por 1K TPM/Hora

Entrada pré-paga

Por 10K TPM/Dia

Saída pré-paga

Por 1K TPM/Dia

Qwen3.8-Max

qwen3.8-max

1M

$4.8

$1.44

$57.6

$17.28

Qwen3.7-Flash-2026-07-15 Entre em contato com seu gerente de negócios para ativar

qwen3.7-flash-2026-07-15

128K

$0.072

$0.031

$0.864

$0.374

Qwen3.7-Max-2026-05-20

qwen3.7-max-2026-05-20

256K

$1.92

$1.8

$72

$21.6

Qwen3.7-Plus-2026-05-26

qwen3.7-plus-2026-05-26

256K

$0.96

$0.384

$11.52

$4.608

Qwen3.6-Plus-2026-04-02

qwen3.6-plus-2026-04-02

128K

$1.2

$0.72

$14.4

$8.64

Qwen3.5-Plus-2026-04-20

qwen3.5-plus-2026-04-20

128K

$0.96

$0.576

$11.52

$6.912

China North 2 (Beijing)

  • Qwen
  • DeepSeek
  • Qwen-VL
  • GLM

Nome do modelo

Código do modelo

Máximo de tokens de entrada

Entrada pagamento conforme o uso

Por 10K TPM/hora

Saída pagamento conforme o uso

Por 1K TPM/hora

Entrada pré-paga

Por 10K TPM/dia

Saída pré-paga

Por 1K TPM/dia

Qwen3.8-Max

qwen3.8-max

1M

$3.96

$1.188

$47.53

$14.258

Qwen3.7-Flash-2026-07-15 Entre em contato com seu gerente de negócios para ativar

qwen3.7-flash-2026-07-15

128K

$0.066

$0.026

$0.792

$0.317

Qwen3.7-Max-2026-05-20

qwen3.7-max-2026-05-20

256K

$3.96

$1.188

$47.53

$14.258

Qwen3.7-Plus-2026-05-26

qwen3.7-plus-2026-05-26

256K

$0.66

$0.264

$7.92

$3.168

Qwen3.6-Plus-2026-04-02

qwen3.6-plus-2026-04-02

128K

$0.67

$0.066

$7.93

$4.753

Qwen3.5-Plus-2026-04-20

qwen3.5-plus-2026-04-20

128K

$0.26

$0.16

$3.17

$1.9

Qwen3-Max-2025-09-23

qwen3-max-2025-09-23

128K

$1.11

$0.45

$13.32

$5.4

Qwen-Flash-2025-07-28

qwen-flash-2025-07-28

128K

$0.06

$0.06

$0.72

$0.72

Qwen-Plus-2025-12-01

qwen-plus-2025-12-01

128K

$0.28

Sem raciocínio: $0.07

Com raciocínio: $0.28

$3.36

Sem raciocínio: $0.84

Com raciocínio: $3.36

Para implantar mais modelos, consulte esta solução e selecione o plano de implantação mais adequado às necessidades do seu negócio.

Métodos de implantação

É possível implantar modelos no console. Siga as etapas abaixo:
Caso receba um aviso de permissões insuficientes, consulte: What should I do if "insufficient permissions" is prompted during deployment?
  1. Acesse o model deployment console.

image

image

  1. Insira o nome do service, selecione um modelo e um método de faturamento, mantenha as demais configurações padrão e clique em OK.

  1. Quando o status da implantação for Running, o modelo terá sido implantado com sucesso.

Cobranças serão geradas após a implantação bem-sucedida do modelo.

Configuração de implantação

  • Model Unit

Item de configuração

Detalhes da configuração

Nome do service

Nome personalizado para o service de implantação.

Modelo

Selecione o modelo a ser implantado, incluindo modelos predefinidos da plataforma e modelos ajustados finamente.

Tipo de unidade de modelo

Selecione a especificação de implantação. Especificações diferentes correspondem a capacidades computacionais e desempenhos distintos.

Quantidade de réplicas

Defina o número inicial de réplicas de implantação, o que afeta a capacidade de processamento simultâneo do service.

Modelo de implantação

Selecione um modelo de implantação (por exemplo, "implantação em nó único"). Modelos diferentes correspondem a esquemas distintos de configuração de recursos. Disponível apenas no modo de faturamento por unidade de modelo.

Modo de inferência do modelo

Para alguns modelos, quando implantados no modo Model Unit, é possível configurar o modo de inferência, contexto máximo, entre outros.

  • Instruct - O modelo executa inferência em modo sem raciocínio após a implantação.

  • Thinking - O modelo executa inferência em modo de raciocínio após a implantação.

Contexto máximo

O modo de implantação Model Unit de alguns modelos suporta esta configuração. O comprimento máximo de contexto depende do tipo de modelo.

Limitação de taxa do service

O modo de implantação Model Unit de alguns modelos suporta esta configuração, permitindo limitar o RPM e o TPM das chamadas ao modelo.

Página da lista de implantações

Após uma implantação bem-sucedida, visualize e gerencie todos os services de implantação na página da lista de implantações. Esta página contém as seguintes informações:
  • Nome do service: Nome do service de implantação. Clique para visualizar os detalhes da implantação.
  • Nome do modelo: Modelo utilizado na implantação.
  • Código do Modelo: Identificador exclusivo gerado após a implantação bem-sucedida do modelo, usado para especificar o modelo ao chamar a API.
  • Status da implantação/Status do evento: Inclui Implantação pendente, Implantando, Running, Falha na implantação, Desativando, Service pausado, Stopped, Excluindo, Assinatura suspensa/Suspensão por pagamento atrasado, Retomando service, Running (Alterando configuração), Running (Falha na alteração) e outros status.
  • Método de faturamento: Método de faturamento do service de implantação atual.
  • Detalhes da implantação: Informações de configuração como tipo de unidade de modelo e quantidade de réplicas.
  • Detalhes da limitação de taxa: Exibe a configuração de limitação de taxa do service de implantação atual, como RPM (requisições por minuto) e TPM (tokens por minuto).
  • Tempo de service: Mostra a hora de criação e a hora de expiração do service de implantação.
  • Operação: Dependendo do status da implantação e do método de faturamento, execute operações como Update, Monitor, Scale, Renew, Take offline, Delete e Try.

Chamadas pós-implantação

Após a implantação bem-sucedida do modelo, chame-o por meio de OpenAI-compatible, Dashscope e Assistant SDK. Ao chamar um modelo implantado com sucesso, o valor de model deve ser o code do modelo gerado após a implantação. Acesse o console de implantação de modelos para obter o Model Code.
image
import os
import dashscope

messages = [
    {"role": "system", "content": "You are a helpful assistant."},
    {"role": "user", "content": "Who are you?"},
]
dashscope.base_http_api_url = 'https://dashscope-intl.aliyuncs.com/api/v1'
response = dashscope.Generation.call(
    # If you have not configured environment variables, replace the next line with your Bailian API Key: api_key="sk-xxx",
    api_key=os.getenv("DASHSCOPE_API_KEY"),
    model="qwen3-max-xxx-xxx",  # Please replace with the code returned after the model is successfully deployed
    messages=messages,
    result_format="message",
    enable_thinking=False,
)
print(response)

Dimensionamento de um Service de Implantação

  • Throughput predefinido (faturado por duração): Clique no botão Scaling para ajustar manualmente o número de instâncias de forma autônoma. Para regras detalhadas de redução de taxas e reembolso, consulte: Refund rules for configuration downgrades.
  • Unidade de modelo (faturado por duração): Utilize o botão Scaling para ajustar manualmente o número de instâncias de forma autônoma.
Além disso, configure uma política de dimensionamento automático (incluindo limiares de dimensionamento, quantidade mínima/máxima de réplicas, dimensionamento agendado, etc.) por meio do botão de configuração de dimensionamento na coluna de operação.

Desativar um Service de Implantação

Acesse o Console de Implantação de Modelos, localize o service de implantação que deseja parar e clique na operação correspondente de acordo com o tipo de faturamento:
  • Unidade de modelo pré-paga: Clique em Deactivate e confirme.
  • Pós-pago: Clique em Delete e confirme.
Nenhuma cobrança adicional será gerada após a conclusão da operação.
image

Outras Operações

Além de desativar, a coluna de operação na página da lista de implantações também suporta as seguintes ações:
  • Update: Atualize a versão do modelo do service implantado, com suporte para atualização completa ou em lote (canary release).
  • Delete: Services de pagamento conforme o uso podem ser excluídos diretamente para interromper o faturamento.
  • Renew: Renove services pré-pagos para estender o tempo de service, com suporte à renovação automática.
  • Buy capacity package: Adquira um pacote de capacidade para a implantação de throughput predefinido.

FAQ

Posso carregar e implantar meus próprios modelos?

O carregamento e a implantação de modelos próprios ainda não são suportados. Recomendamos acompanhar as últimas atualizações do Alibaba Cloud Model Studio. Adicionalmente, a Plataforma de Inteligência Artificial PAI do Alibaba Cloud oferece a capacidade de implantar seus próprios modelos. Consulte PAI-LLM Large Language Model Deployment para conhecer o método de implantação.

O que devo fazer se "permissões insuficientes" for exibido durante a implantação?

  1. Caso "Missing permission for this module" seja exibido, garanta que sua conta possua a permissão Model Deployment - Operation na página de gerenciamento de permissões do espaço de trabalho.
    PixPin_2025-11-27_15-09-44
    Se não conseguir operar normalmente, entre em contato com sua organização ou administrador de TI para adicionar as permissões relevantes ou verificar os problemas de permissão em seu nome.
  2. Se o erro "xx business space does not have permission to deploy the xx model" for reportado durante a implantação, acesse a página de Gerenciamento de Espaço de Trabalho do Model Studio para adicionar a permissão de implantação do modelo correspondente ao espaço de trabalho adequado.
    Erro de chamada de API: Workspace xxx does not have deployment privilege for model xxxx .
    PixPin_2025-11-27_15-03-57
    PixPin_2025-11-27_15-06-41
    Caso permissões insuficientes sejam solicitadas, contate sua organização ou administrador de TI para adicionar as permissões relevantes ou operar em seu nome.
Plano de Tokens
Playground de Modelos
  • Music generation
Inferência do Modelo
Avaliação
Compressão de Modelos
Estatísticas e Monitoramento
Suporte