Skip to main content
Geração de Texto

Criar implantação

Crie uma tarefa de implantação de modelo.

Pré-requisitos

Implantação de modelo

Endpoint

POST https://dashscope-intl.aliyuncs.com/api/v1/deployments

Exemplos de requisição

Parâmetros da requisição

Parâmetro

Tipo

Localização

Obrigatório

Descrição

model_name

String

body

Sim

Nome do modelo a ser implantado. Corresponde ao ID do modelo em My Models. Também é possível obter esse ID na saída das operações Create Training Job ou Create Import Job.

plan

String

body

Sim

Plano de implantação. Os seguintes métodos de faturamento têm suporte:

Método de faturamento

Configuração do plano

Faturamento por unidade de modelo

"plan": "mu"

Faturamento por unidade de computação

"plan": "cu"

Throughput provisionado

"plan": "ptu"

Implantação compartilhada LoRA (faturada por uso de tokens)

"plan": "lora"

É possível localizar rapidamente os planos de implantação compatíveis com um modelo ajustado em My Models.

Atualmente, os modelos CosyVoice ajustados oferecem suporte apenas a "plan": "mu".

name

String

body

Sim

Nome de exibição do modelo no console.

capacity

Integer

body

Não

Obrigatório apenas quando "plan": "mu" for especificado. Defina o número de unidades de recurso para a implantação. O valor deve ser um múltiplo inteiro de base_capacity. As restrições variam conforme o valor de deploy_spec. Por exemplo, para MU2, o valor deve ser múltiplo de 8; já para MU5, pode ser 1. Exemplo: "capacity": 1.

Os modelos CosyVoice oferecem atualmente os dois seguintes modelos de implantação com as respectivas restrições de capacity:

  • Implantação em nó único: capacity deve ser um múltiplo inteiro de 1, como 1, 2, 3, 4 ou 5.

  • Implantação em nó único - edição flagship de inferência complexa: capacity deve ser um múltiplo inteiro de 8, como 8, 16, 24 ou 32.

billing_method

String

body

Não

Obrigatório apenas quando "plan": "mu" for especificado. Atualmente, há suporte apenas para "POST_PAY" (Pós-pago). Exemplo: "billing_method": "POST_PAY".

deploy_spec

String

body

Não

Esta configuração aplica-se apenas quando "plan": "mu" for especificado.

Para detalhes sobre o suporte a recursos, consulte Suporte a recursos para implantação por unidade de modelo.

Este parâmetro é obrigatório quando "plan": "mu" for especificado. Exemplo: "deploy_spec": "MU1".

Obtenha este valor no campo template_id retornado pela operação Get Deployable Model List.

enable_thinking

Boolean

body

Não

Compatível com alguns modelos. Defina como true ou false.

max_context_length

Number

body

Não

Compatível com alguns modelos. Exemplo: "max_context_length": 131072.

rpm_limit

Number

body

Não

Compatível com alguns modelos. Especifique o número máximo de requisições por minuto (RPM).

tpm_limit

Number

body

Não

Compatível com alguns modelos. Especifique o número máximo de tokens por minuto (TPM).

ptu_capacity

Object

body

Não

Esta configuração aplica-se apenas quando "plan": "ptu" for especificado.

Para detalhes sobre o suporte a recursos, consulte Suporte a recursos para implantação PTU.

Se você não especificar este parâmetro, o sistema usará os padrões 10.000 input_tpm e 1.000 output_tpm.

Exemplo: "ptu_capacity": { "input_tpm": 10000, "output_tpm": 1000 }.

Exemplo: "ptu_capacity": { "input_tpm": 10000, "output_tpm": 1000 }.

ptu_capacity.input_tpm

Number

body

Não

Compatível com todos os modelos. Especifique o número máximo de tokens de entrada por minuto (TPM).

ptu_capacity.output_tpm

Number

body

Não

Compatível com todos os modelos. Especifique o número máximo de tokens de saída por minuto (TPM).

ptu_capacity.thinking_output_tpm

Number

body

Não

Compatível com alguns modelos. Especifique o número máximo de tokens de saída de raciocínio provisionados por minuto (TPM).

suffix

String

body

Não

Após a implantação de um modelo, um novo nome é gerado. O parâmetro suffix define o sufixo para esse novo nome. Ele deve ser globalmente exclusivo e ter no máximo 8 caracteres. É possível omitir o sufixo na primeira implantação de um modelo. Se você implantar o mesmo modelo várias vezes, especifique um sufixo exclusivo para cada implantação.

Consulte o parâmetro de saída deployed_model para obter mais informações.

Modelos compatíveis

Exemplo de resposta

O comando retorna o seguinte:
{
  "request_id": "f2ae64f7-83cc-410c-bc0b-840443f7eb86",
  "output": {
    "deployed_model": "emo-35b3f106-sample01",
    "gmt_create": "2025-06-17T11:00:38.68",
    "gmt_modified": "2025-06-17T11:00:38.68",
    "status": "PENDING",
    "model_name": "emo",
    "base_model": "emo",
    "base_capacity": 1,
    "capacity": 1,
    "ready_capacity": 0,
    "workspace_id": "llm-v71tlv3d***",
    "charge_type": "post_paid",
    "creator": "175805416***",
    "modifier": "175805416***"
  }
}

Parâmetros da resposta

ParâmetroTipoDescrição
request_idStringID da requisição.
outputObjectDetalhes da tarefa de implantação.
deployed_modelStringIdentificador exclusivo do modelo implantado. Este ID é usado em operações de API, como consultar detalhes da implantação, modificar limitação de taxa da implantação, dimensionamento da implantação e excluir implantações, além de ser passado como parâmetro SDK ao invocar o modelo.
gmt_createStringHorário de criação da tarefa de implantação.
gmt_modifiedStringHorário da última modificação da tarefa de implantação.
statusStringStatus da tarefa de implantação.
  • PENDING: A tarefa está sendo criada.
  • UPDATING: A tarefa está sendo atualizada.
  • RUNNING: A tarefa de implantação está em execução e o modelo implantado pode processar requisições.
  • STOPPED: A tarefa de implantação foi interrompida e não gera cobrança.
  • DELETING: A tarefa está sendo excluída.
  • FAILED: Falha na criação ou atualização da tarefa.
model_nameStringNome do modelo utilizado na tarefa de implantação.
base_modelStringID do modelo base utilizado na tarefa de implantação.
base_capacityNumberNúmero mínimo de unidades de recurso necessárias para executar o modelo base.
capacityNumberNúmero de unidades de recurso utilizadas pela tarefa de implantação.
ready_capacityNumberQuantidade de unidades de recurso prontas para processar requisições imediatamente. A velocidade de inicialização de recursos ou o status do hardware podem limitar este valor.
workspace_idStringID do workspace da tarefa de implantação.
charge_typeStringMétodo de faturamento da tarefa de implantação.
post_paid: Pós-pago.
creatorStringUID do usuário que criou a tarefa de implantação.
modifierStringUID do usuário que modificou a tarefa de implantação pela última vez.
planStringModelo de faturamento da tarefa de implantação. Este parâmetro não é retornado para alguns modelos de faturamento.
Retornado apenas para implantações de Model Unit.
model_unit_specStringEspecificação da unidade de modelo.
enable_thinkingBooleanIndica se o modo Thinking está ativado. Este recurso está disponível apenas para determinados modelos.
max_context_lengthNumberComprimento máximo do contexto.
rpm_limitStringNúmero máximo de requisições por minuto (RPM).
tpm_limitNumberNúmero máximo de tokens por minuto (TPM).
Retornado apenas para implantações de throughput provisionado (PTU).
ptu_capacityObjectEste parâmetro entra em vigor apenas quando "plan": "ptu" estiver definido.Exemplo: "ptu_capacity": { "input_tpm": 10000, "output_tpm": 1000 }.
ptu_capacity.input_tpmNumberNúmero máximo de tokens de entrada por minuto (TPM) para o modelo implantado. Todos os modelos são compatíveis com este recurso.
ptu_capacity.output_tpmNumberNúmero máximo de tokens de saída por minuto (TPM) para o modelo implantado. Todos os modelos são compatíveis com este recurso.
ptu_capacity.thinking_output_tpmNumberNúmero máximo de tokens de saída de raciocínio por minuto (TPM) para o modelo implantado. Este recurso está disponível apenas para determinados modelos.

Resposta de erro

Exemplo de resposta

{
    "request_id": "ca218d57-b91b-46b2-bd35-c41c6287bcf4",
    "message": "Model: qwen-plus-20230703-cx7f not found!",
    "code": "NotFound"
}

Parâmetros da resposta

Parâmetro

Tipo

Descrição

request_id

String

ID exclusivo da requisição.

code

String

Código do erro.

message

String

Mensagem de erro.

Os seguintes erros podem ocorrer quando uma requisição falha:

Código de erro

Mensagem de erro

Motivo

NotFound

Model: xxx not found!

  • Você está criando uma tarefa de implantação com um modelo inexistente.

  • Você está consultando, atualizando ou excluindo uma tarefa de implantação com um modelo inexistente.

Conflict

Deployed model xxx already exists, please specify a suffix.

Você está criando uma tarefa de implantação com um sufixo já em uso.

InvalidParameter

Invalid capacity (xx), capacity must be larger than or equal to 0 and multiples of 1 and less than 1000!

Você está criando ou atualizando uma tarefa de implantação com um número inválido de unidades de capacidade.

Referência da API de Geração de Texto
Geração de Imagens
  • FAQ
Geração de Vídeo
Áudio
API em tempo real
Incorporação de Texto
Produção de Modelos