Seja utilizando os modelos pré-configurados da plataforma ou seus próprios modelos ajustados finamente, a implantação permite obter um service de inferência independente e com recursos dedicados. Essa abordagem atende às necessidades do seu negócio em diferentes níveis de desempenho, como alta concorrência e baixa latência.
Métodos de faturamento
Antes da implantação, consulte o custo horário estimado dos diferentes modelos no console de Model Deployment .
Provisioned Throughput (PTU, Provisioned Throughput Unit) (Alto throughput; alto desempenho) | Model Unit (Métricas de desempenho personalizadas; isolamento de recursos) | Uso baseado em Tokens (Pagamento conforme o uso após ajuste fino/validação de efeito) | |||
|---|---|---|---|---|---|
Definição | Método de implantação de modelos que reserva recursos da plataforma para garantir uma capacidade específica de throughput de TPM; sem limitação de taxa dentro da cota garantida. | Método de implantação de modelos que configura o poder computacional com base na duração de uso e na quantidade de Model Units, oferecendo recursos dedicados. | Método de implantação de modelos que utiliza os Tokens de entrada e os Tokens de saída gerados por chamada como base para medição de uso. | ||
Vantagens |
|
| Sem cobrança quando não estiver em uso. | ||
Modelos suportados | Alguns modelos pré-configurados | Alguns modelos pré-configurados e todos os modelos ajustados finamente | Alguns modelos ajustados finamente com LoRA | ||
Casos de uso |
|
| Validação de efeito de modelo ajustado finamente | ||
Diagrama de faturamento | ![]() | ![]() | ![]() | ||
Método de faturamento | Por duração de uso e throughput provisionado Pagamento conforme o uso, pacote diário | Por duração de uso e quantidade de Model Units Pagamento conforme o uso, pacote mensal | Por uso de Tokens do modelo Pagamento conforme o uso | ||
Método de dimensionamento | Aumento/diminuição self-service do throughput | Aumento/diminuição self-service de Model Units | Envie uma solicitação no console e aguarde a revisão manual. | ||
Restrições do product |
| Após uma compra pré-paga, se você cancelar antecipadamente dentro do primeiro mês, o preço unitário diário (≈ preço unitário mensal / 30) será cobrado multiplicado por 1,2 |
| ||
Detalhes de faturamento
- Tab
- Faturamento por duração de uso (Model Unit)
- Por uso de tokens do modelo
Singapore
- Qwen
- DeepSeek
- Qwen-VL
- GLM
Nome do modelo | Código do modelo | Máximo de tokens de entrada | Entrada pós-paga Por 10K TPM/Hora | Saída pós-paga Por 1K TPM/Hora | Entrada pré-paga Por 10K TPM/Dia | Saída pré-paga Por 1K TPM/Dia |
|---|---|---|---|---|---|---|
Qwen3.8-Max | qwen3.8-max | 1M | $4.8 | $1.44 | $57.6 | $17.28 |
Qwen3.7-Flash-2026-07-15 Entre em contato com seu gerente de negócios para ativar | qwen3.7-flash-2026-07-15 | 128K | $0.072 | $0.031 | $0.864 | $0.374 |
Qwen3.7-Max-2026-05-20 | qwen3.7-max-2026-05-20 | 256K | $1.92 | $1.8 | $72 | $21.6 |
Qwen3.7-Plus-2026-05-26 | qwen3.7-plus-2026-05-26 | 256K | $0.96 | $0.384 | $11.52 | $4.608 |
Qwen3.6-Plus-2026-04-02 | qwen3.6-plus-2026-04-02 | 128K | $1.2 | $0.72 | $14.4 | $8.64 |
Qwen3.5-Plus-2026-04-20 | qwen3.5-plus-2026-04-20 | 128K | $0.96 | $0.576 | $11.52 | $6.912 |
China North 2 (Beijing)
- Qwen
- DeepSeek
- Qwen-VL
- GLM
Nome do modelo | Código do modelo | Máximo de tokens de entrada | Entrada pagamento conforme o uso Por 10K TPM/hora | Saída pagamento conforme o uso Por 1K TPM/hora | Entrada pré-paga Por 10K TPM/dia | Saída pré-paga Por 1K TPM/dia |
|---|---|---|---|---|---|---|
Qwen3.8-Max | qwen3.8-max | 1M | $3.96 | $1.188 | $47.53 | $14.258 |
Qwen3.7-Flash-2026-07-15 Entre em contato com seu gerente de negócios para ativar | qwen3.7-flash-2026-07-15 | 128K | $0.066 | $0.026 | $0.792 | $0.317 |
Qwen3.7-Max-2026-05-20 | qwen3.7-max-2026-05-20 | 256K | $3.96 | $1.188 | $47.53 | $14.258 |
Qwen3.7-Plus-2026-05-26 | qwen3.7-plus-2026-05-26 | 256K | $0.66 | $0.264 | $7.92 | $3.168 |
Qwen3.6-Plus-2026-04-02 | qwen3.6-plus-2026-04-02 | 128K | $0.67 | $0.066 | $7.93 | $4.753 |
Qwen3.5-Plus-2026-04-20 | qwen3.5-plus-2026-04-20 | 128K | $0.26 | $0.16 | $3.17 | $1.9 |
Qwen3-Max-2025-09-23 | qwen3-max-2025-09-23 | 128K | $1.11 | $0.45 | $13.32 | $5.4 |
Qwen-Flash-2025-07-28 | qwen-flash-2025-07-28 | 128K | $0.06 | $0.06 | $0.72 | $0.72 |
Qwen-Plus-2025-12-01 | qwen-plus-2025-12-01 | 128K | $0.28 | Sem raciocínio: $0.07 Com raciocínio: $0.28 | $3.36 | Sem raciocínio: $0.84 Com raciocínio: $3.36 |
Métodos de implantação
É possível implantar modelos no console. Siga as etapas abaixo:
Caso receba um aviso de permissões insuficientes, consulte: What should I do if "insufficient permissions" is prompted during deployment?
| ![]() ![]() |
| |
Cobranças serão geradas após a implantação bem-sucedida do modelo. |
Configuração de implantação
- Model Unit
Item de configuração | Detalhes da configuração |
|---|---|
Nome do service | Nome personalizado para o service de implantação. |
Modelo | Selecione o modelo a ser implantado, incluindo modelos predefinidos da plataforma e modelos ajustados finamente. |
Tipo de unidade de modelo | Selecione a especificação de implantação. Especificações diferentes correspondem a capacidades computacionais e desempenhos distintos. |
Quantidade de réplicas | Defina o número inicial de réplicas de implantação, o que afeta a capacidade de processamento simultâneo do service. |
Modelo de implantação | Selecione um modelo de implantação (por exemplo, "implantação em nó único"). Modelos diferentes correspondem a esquemas distintos de configuração de recursos. Disponível apenas no modo de faturamento por unidade de modelo. |
Modo de inferência do modelo | Para alguns modelos, quando implantados no modo Model Unit, é possível configurar o modo de inferência, contexto máximo, entre outros.
|
Contexto máximo | O modo de implantação Model Unit de alguns modelos suporta esta configuração. O comprimento máximo de contexto depende do tipo de modelo. |
Limitação de taxa do service | O modo de implantação Model Unit de alguns modelos suporta esta configuração, permitindo limitar o RPM e o TPM das chamadas ao modelo. |
Página da lista de implantações
Após uma implantação bem-sucedida, visualize e gerencie todos os services de implantação na página da lista de implantações. Esta página contém as seguintes informações:
- Nome do service: Nome do service de implantação. Clique para visualizar os detalhes da implantação.
- Nome do modelo: Modelo utilizado na implantação.
- Código do Modelo: Identificador exclusivo gerado após a implantação bem-sucedida do modelo, usado para especificar o modelo ao chamar a API.
- Status da implantação/Status do evento: Inclui Implantação pendente, Implantando, Running, Falha na implantação, Desativando, Service pausado, Stopped, Excluindo, Assinatura suspensa/Suspensão por pagamento atrasado, Retomando service, Running (Alterando configuração), Running (Falha na alteração) e outros status.
- Método de faturamento: Método de faturamento do service de implantação atual.
- Detalhes da implantação: Informações de configuração como tipo de unidade de modelo e quantidade de réplicas.
- Detalhes da limitação de taxa: Exibe a configuração de limitação de taxa do service de implantação atual, como RPM (requisições por minuto) e TPM (tokens por minuto).
- Tempo de service: Mostra a hora de criação e a hora de expiração do service de implantação.
- Operação: Dependendo do status da implantação e do método de faturamento, execute operações como Update, Monitor, Scale, Renew, Take offline, Delete e Try.
Chamadas pós-implantação
Após a implantação bem-sucedida do modelo, chame-o por meio de OpenAI-compatible, Dashscope e Assistant SDK.
Ao chamar um modelo implantado com sucesso, o valor de model deve ser o code do modelo gerado após a implantação. Acesse o console de implantação de modelos para obter o Model Code.

Dimensionamento de um Service de Implantação
- Throughput predefinido (faturado por duração): Clique no botão Scaling para ajustar manualmente o número de instâncias de forma autônoma. Para regras detalhadas de redução de taxas e reembolso, consulte: Refund rules for configuration downgrades.
- Unidade de modelo (faturado por duração): Utilize o botão Scaling para ajustar manualmente o número de instâncias de forma autônoma.
Desativar um Service de Implantação
Acesse o Console de Implantação de Modelos, localize o service de implantação que deseja parar e clique na operação correspondente de acordo com o tipo de faturamento:
- Unidade de modelo pré-paga: Clique em Deactivate e confirme.
- Pós-pago: Clique em Delete e confirme.

Outras Operações
Além de desativar, a coluna de operação na página da lista de implantações também suporta as seguintes ações:
- Update: Atualize a versão do modelo do service implantado, com suporte para atualização completa ou em lote (canary release).
- Delete: Services de pagamento conforme o uso podem ser excluídos diretamente para interromper o faturamento.
- Renew: Renove services pré-pagos para estender o tempo de service, com suporte à renovação automática.
- Buy capacity package: Adquira um pacote de capacidade para a implantação de throughput predefinido.
FAQ
Posso carregar e implantar meus próprios modelos?
O carregamento e a implantação de modelos próprios ainda não são suportados. Recomendamos acompanhar as últimas atualizações do Alibaba Cloud Model Studio.
Adicionalmente, a Plataforma de Inteligência Artificial PAI do Alibaba Cloud oferece a capacidade de implantar seus próprios modelos. Consulte PAI-LLM Large Language Model Deployment para conhecer o método de implantação.
O que devo fazer se "permissões insuficientes" for exibido durante a implantação?
-
Caso "Missing permission for this module" seja exibido, garanta que sua conta possua a permissão Model Deployment - Operation na página de gerenciamento de permissões do espaço de trabalho.
Se não conseguir operar normalmente, entre em contato com sua organização ou administrador de TI para adicionar as permissões relevantes ou verificar os problemas de permissão em seu nome.

-
Se o erro "xx business space does not have permission to deploy the xx model" for reportado durante a implantação, acesse a página de Gerenciamento de Espaço de Trabalho do Model Studio para adicionar a permissão de implantação do modelo correspondente ao espaço de trabalho adequado.
Erro de chamada de API:
Workspace xxx does not have deployment privilege for model xxxx.
Caso permissões insuficientes sejam solicitadas, contate sua organização ou administrador de TI para adicionar as permissões relevantes ou operar em seu nome.




