Crie uma tarefa de implantação de modelo.
Pré-requisitos
- Leia a Introdução à implantação de modelos e o guia para Implantar um modelo usando a API para entender o funcionamento da implantação de modelos e o fluxo de trabalho básico no Alibaba Cloud Model Studio.
- Configure sua chave de API do Model Studio. Para mais detalhes, consulte Obter uma chave de API.
Implantação de modelo
Endpoint
Exemplos de requisição
Parâmetros da requisição
Parâmetro | Tipo | Localização | Obrigatório | Descrição | |||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
model_name | String | body | Sim | Nome do modelo a ser implantado. Corresponde ao ID do modelo em My Models. Também é possível obter esse ID na saída das operações Create Training Job ou Create Import Job. | |||||||||||
plan | String | body | Sim | Plano de implantação. Os seguintes métodos de faturamento têm suporte:
É possível localizar rapidamente os planos de implantação compatíveis com um modelo ajustado em My Models. Atualmente, os modelos CosyVoice ajustados oferecem suporte apenas a | |||||||||||
name | String | body | Sim | Nome de exibição do modelo no console. | |||||||||||
capacity | Integer | body | Não | Obrigatório apenas quando Os modelos CosyVoice oferecem atualmente os dois seguintes modelos de implantação com as respectivas restrições de
| |||||||||||
billing_method | String | body | Não | Obrigatório apenas quando | |||||||||||
deploy_spec | String | body | Não | Esta configuração aplica-se apenas quando Para detalhes sobre o suporte a recursos, consulte Suporte a recursos para implantação por unidade de modelo. | Este parâmetro é obrigatório quando Obtenha este valor no campo | ||||||||||
enable_thinking | Boolean | body | Não | Compatível com alguns modelos. Defina como | |||||||||||
max_context_length | Number | body | Não | Compatível com alguns modelos. Exemplo: | |||||||||||
rpm_limit | Number | body | Não | Compatível com alguns modelos. Especifique o número máximo de requisições por minuto (RPM). | |||||||||||
tpm_limit | Number | body | Não | Compatível com alguns modelos. Especifique o número máximo de tokens por minuto (TPM). | |||||||||||
ptu_capacity | Object | body | Não | Esta configuração aplica-se apenas quando Para detalhes sobre o suporte a recursos, consulte Suporte a recursos para implantação PTU. Se você não especificar este parâmetro, o sistema usará os padrões | Exemplo: Exemplo: | ||||||||||
ptu_capacity.input_tpm | Number | body | Não | Compatível com todos os modelos. Especifique o número máximo de tokens de entrada por minuto (TPM). | |||||||||||
ptu_capacity.output_tpm | Number | body | Não | Compatível com todos os modelos. Especifique o número máximo de tokens de saída por minuto (TPM). | |||||||||||
ptu_capacity.thinking_output_tpm | Number | body | Não | Compatível com alguns modelos. Especifique o número máximo de tokens de saída de raciocínio provisionados por minuto (TPM). | |||||||||||
suffix | String | body | Não | Após a implantação de um modelo, um novo nome é gerado. O parâmetro suffix define o sufixo para esse novo nome. Ele deve ser globalmente exclusivo e ter no máximo 8 caracteres. É possível omitir o sufixo na primeira implantação de um modelo. Se você implantar o mesmo modelo várias vezes, especifique um sufixo exclusivo para cada implantação. Consulte o parâmetro de saída deployed_model para obter mais informações. | |||||||||||
Modelos compatíveis
Visualize os recursos compatíveis e o faturamento.
Visualize os recursos compatíveis e o faturamento.
Exemplo de resposta
O comando retorna o seguinte:
Parâmetros da resposta
| Parâmetro | Tipo | Descrição |
|---|---|---|
| request_id | String | ID da requisição. |
| output | Object | Detalhes da tarefa de implantação. |
| deployed_model | String | Identificador exclusivo do modelo implantado. Este ID é usado em operações de API, como consultar detalhes da implantação, modificar limitação de taxa da implantação, dimensionamento da implantação e excluir implantações, além de ser passado como parâmetro SDK ao invocar o modelo. |
| gmt_create | String | Horário de criação da tarefa de implantação. |
| gmt_modified | String | Horário da última modificação da tarefa de implantação. |
| status | String | Status da tarefa de implantação.
|
| model_name | String | Nome do modelo utilizado na tarefa de implantação. |
| base_model | String | ID do modelo base utilizado na tarefa de implantação. |
| base_capacity | Number | Número mínimo de unidades de recurso necessárias para executar o modelo base. |
| capacity | Number | Número de unidades de recurso utilizadas pela tarefa de implantação. |
| ready_capacity | Number | Quantidade de unidades de recurso prontas para processar requisições imediatamente. A velocidade de inicialização de recursos ou o status do hardware podem limitar este valor. |
| workspace_id | String | ID do workspace da tarefa de implantação. |
| charge_type | String | Método de faturamento da tarefa de implantação.
|
| creator | String | UID do usuário que criou a tarefa de implantação. |
| modifier | String | UID do usuário que modificou a tarefa de implantação pela última vez. |
| plan | String | Modelo de faturamento da tarefa de implantação. Este parâmetro não é retornado para alguns modelos de faturamento. |
| Retornado apenas para implantações de Model Unit. | ||
| model_unit_spec | String | Especificação da unidade de modelo. |
| enable_thinking | Boolean | Indica se o modo Thinking está ativado. Este recurso está disponível apenas para determinados modelos. |
| max_context_length | Number | Comprimento máximo do contexto. |
| rpm_limit | String | Número máximo de requisições por minuto (RPM). |
| tpm_limit | Number | Número máximo de tokens por minuto (TPM). |
| Retornado apenas para implantações de throughput provisionado (PTU). | ||
| ptu_capacity | Object | Este parâmetro entra em vigor apenas quando "plan": "ptu" estiver definido.Exemplo: "ptu_capacity": { "input_tpm": 10000, "output_tpm": 1000 }. |
| ptu_capacity.input_tpm | Number | Número máximo de tokens de entrada por minuto (TPM) para o modelo implantado. Todos os modelos são compatíveis com este recurso. |
| ptu_capacity.output_tpm | Number | Número máximo de tokens de saída por minuto (TPM) para o modelo implantado. Todos os modelos são compatíveis com este recurso. |
| ptu_capacity.thinking_output_tpm | Number | Número máximo de tokens de saída de raciocínio por minuto (TPM) para o modelo implantado. Este recurso está disponível apenas para determinados modelos. |
Resposta de erro
Exemplo de resposta
Parâmetros da resposta
Parâmetro | Tipo | Descrição |
|---|---|---|
request_id | String | ID exclusivo da requisição. |
code | String | Código do erro. |
message | String | Mensagem de erro. |
Código de erro | Mensagem de erro | Motivo |
|---|---|---|
NotFound | Model: xxx not found! |
|
Conflict | Deployed model xxx already exists, please specify a suffix. | Você está criando uma tarefa de implantação com um sufixo já em uso. |
InvalidParameter | Invalid capacity (xx), capacity must be larger than or equal to 0 and multiples of 1 and less than 1000! | Você está criando ou atualizando uma tarefa de implantação com um número inválido de unidades de capacidade. |