Skip to main content
Implantação

Deploy a model by using an API or CLI

Este tópico mostra como implantar um modelo Qwen no Alibaba Cloud Model Studio por meio de chamadas de API.

Pré-requisitos

1. Implante o modelo

O comando abaixo usa o modelo personalizado ajustado qwen3-8b-ft-202511132025-0260 para criar um serviço dedicado chamado qwen3-8b-ft-202511132025-0260. Para obter o ID do modelo personalizado, acesse a página Console do Model Studio - ajuste fino de modelo. Clique no Task Name do modelo a ser implantado, clique em Outputs e, em seguida, no nome azul do modelo. A página My Models será aberta; nela, localize o Model ID na seção de informações básicas. Use o Model ID como entrada para o parâmetro model_name e implante o modelo via API.
  • Provisioned Throughput (PTU)
  • Model unit
  • Token usage
Após a execução do comando de implantação, o faturamento começa assim que o serviço é implantado com sucesso, mesmo sem uso. Antes de prosseguir, revise as regras de faturamento do serviço.
O método de faturamento por throughput provisionado cobra com base na duração do uso. Essa abordagem é adequada para cenários que exigem throughput estável, alta concorrência, baixa latência e tráfego previsível. Nesse modo, a plataforma provisiona tanto o throughput/concorrência quanto a velocidade de geração, valores que não podem ser ajustados.
curl "https://dashscope-intl.aliyuncs.com/api/v1/deployments" \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--header 'Content-Type: application/json' \
--data '{
    "name": "my_qwen_flash",
    "model_name": "qwen-flash-2025-07-28",
    "plan": "ptu",
    "ptu_capacity": {
        "input_tpm": 10000,
	"output_tpm": 1000
    }
}'
Em caso de sucesso, o comando retorna o seguinte resultado (usando uma implantação LoRA como exemplo):
{
    "request_id": "83b173ab-2b2f-41aa-8c57-b173e8be934e",
    "output":
    {
        "deployed_model": "qwen3-8b-ft-202511132025-0260",
        "gmt_create": "2025-11-20T20:06:46.405",
        "gmt_modified": "2025-11-20T20:06:46.405",
        "status": "PENDING",
        "model_name": "qwen3-8b-ft-202511132025-0260",
        "base_model": "qwen3-8b",
        "workspace_id": "llm-8v*****",
        "charge_type": "post_paid",
        "creator": "16542*****",
        "modifier": "16542*****",
        "plan": "***"
    }
}
Neste retorno, deployed_model representa o ID exclusivo do serviço dedicado.

2. Consulte o status do serviço

Execute o comando abaixo para consultar os detalhes de um serviço dedicado específico:
curl "https://dashscope-intl.aliyuncs.com/api/v1/deployments/qwen3-8b-ft-202511132025-0260" \
    --header "Authorization: Bearer $DASHSCOPE_API_KEY" \
    --header 'Content-Type: application/json'
Se a operação for bem-sucedida, o comando retornará o seguinte resultado:
{
    "request_id": "ca36952d-9136-426e-ab08-68a97ad72719",
    "output":
    {
        "deployed_model": "qwen3-8b-ft-202511132025-0260",
        "gmt_create": "2025-11-20T20:32:08",
        "gmt_modified": "2025-11-20T20:42:25",
        "status": "RUNNING",
        "model_name": "qwen3-8b-ft-202511132025-0260",
        "base_model": "qwen3-8b",
        "base_capacity": 2,
        "capacity": 2,
        "ready_capacity": 2,
        "workspace_id": "llm-8v53etv3hwb8orx1",
        "charge_type": "post_paid",
        "creator": "1654290265984853",
        "modifier": "1654290265984853",
        "plan": "mu",
        "model_unit_spec": "MU1"
    }
}
Quando o status do serviço for RUNNING, a implantação estará concluída.

3. Faça requisições de inferência

Se esta for sua primeira vez utilizando o DashScope SDK, consulte Instalar o SDK.Certifique-se de que o workspace da chave de API corresponda ao workspace de implantação do modelo.
Use o SDK para enviar uma requisição ao serviço dedicado:
from dashscope import Generation
from http import HTTPStatus
import os
response = Generation.call(
    model='qwen3-8b',
    prompt='Who are you?',
    enable_thinking=False,
    api_key=os.getenv('DASHSCOPE_API_KEY'),
)
if response.status_code == HTTPStatus.OK:
    print(response.output)
    print(response.usage)
else:
    print(response.code)
    print(response.message)
Uma execução bem-sucedida retorna o seguinte resultado:
{"text": "I am Qwen, a large language model developed by Alibaba Cloud. I am designed to generate various types of text, such as articles, stories, and poems, and to engage in conversations, answer questions, provide information, and offer help in different scenarios. I'm happy to serve you! If you have any questions or need assistance, please feel free to let me know.", "finish_reason": "stop", "choices": null}
{"input_tokens": 11, "output_tokens": 63, "total_tokens": 74}

4. Exclua o serviço dedicado

A execução do comando de exclusão retira o serviço de implantação do ar imediatamente. Esta ação é irreversível e gera os seguintes efeitos:
  1. Não será mais possível chamar o modelo.
  2. O faturamento do serviço é interrompido.
Caso não precise mais de um serviço dedicado, exclua-o usando o comando abaixo:
curl --request DELETE 'https://dashscope-intl.aliyuncs.com/api/v1/deployments/qwen3-8b-ft-202511132025-0260' \
    --header "Authorization: Bearer $DASHSCOPE_API_KEY" \
    --header 'Content-Type: application/json'
Se a operação for bem-sucedida, o comando retornará o seguinte resultado:
{
    "request_id": "8f726017-6042-420e-a465-0d366a3aba59",
    "output":
    {
        "deployed_model": "qwen3-8b-ft-202511132025-0260",
        "gmt_create": "2025-11-20T20:32:08",
        "gmt_modified": "2025-11-27T16:35:31.591",
        "status": "DELETING",
        "model_name": "qwen3-8b-ft-202511132025-0260",
        "base_model": "qwen3-8b",
        "base_capacity": 2,
        "capacity": 2,
        "ready_capacity": 2,
        "workspace_id": "llm-8v53etv3hwb8orx1",
        "charge_type": "post_paid",
        "creator": "1654290265984853",
        "modifier": "1654290265984853",
        "plan": "mu",
        "model_unit_spec": "MU1"
    }
}
Após excluir o serviço, não será mais possível consultar seu status pelo método descrito em 2. Consulte o status do serviço.

Referência da API

Para obter detalhes sobre as chamadas de API, consulte Detalhes da API.

FAQ

Erros de permissão durante a implantação

Ao implantar um modelo via API, verifique os pontos abaixo:
  1. O Workspace da chave de API deve ter permissão para gerenciar o modelo. Acesse a página Gerenciamento de Espaço de Negócios no Model Studio e verifique as configurações de permissão de implantação de modelo para o workspace correspondente. Na coluna Actions do workspace correspondente, clique em Model Permission and Flow Control Settings. Na Model List, localize o modelo desejado e verifique o status de autorização na coluna Model Deployment. Se aparecer Not Authorized, clique em Edit na coluna Actions para conceder a permissão.
  2. A Owner Account proprietária da chave de API precisa ter as permissões necessárias no Workspace. Acesse o Console do Model Studio, clique no workspace no canto inferior esquerdo, mude para o workspace correto e clique em image para verificar as configurações de permissão de implantação do modelo.
    Erro de chamada de API: Workspace access denied .
    No painel de navegação à esquerda, clique em Permission Management e confirme se a lista de usuários inclui a conta proprietária da chave de API (com o tipo primary account).
Plano de Tokens
Playground de Modelos
  • Music generation
Inferência do Modelo
Avaliação
Compressão de Modelos
Estatísticas e Monitoramento
Suporte
Deploy a model by using an API or CLI - Alibaba Cloud Model Studio