A compressão de modelos utiliza quantização para converter um modelo ajustado de precisão total em uma versão de baixa precisão, reduzindo a especificação de MU e o custo necessário para implantação. Este tópico descreve como crie e gerencie tarefas de compressão de modelos no console.
Visão geral do recurso
A compressão de modelos emprega quantização para transformar um modelo ajustado de precisão total em uma versão de baixa precisão. Esse processo diminui a especificação de MU exigida na implantação e preserva as capacidades do modelo, o que reduz os custos de implantação de inferência. Na plataforma Model Studio, a compressão de modelos refere-se especificamente à quantização e não envolve poda estrutural ou destilação de conhecimento.
A compressão é uma etapa opcional no pipeline de produção de modelos. O pipeline completo é: Fine-tuning → Compressão de modelos → Deployment. Primeiro, conclua o treinamento de ajuste fino; em seguida, comprima o modelo ajustado resultante e, por fim, implante o modelo comprimido como um service de inferência.
Modelos suportados
A tabela abaixo lista os modelos com suporte atual para compressão. Consulte o console para obter a lista definitiva.
Série de modelos | Modelo base | Especificação de implantação antes da compressão | Especificação de implantação após a compressão |
|---|---|---|---|
Qwen | qwen3.5-flash-2026-02-23 | MU1*2(¥108/hour) | MU8*1(¥47/hour) |
Limites de uso
- Disponível apenas na região North China 2 (Beijing).
- Suporta apenas modelos personalizados produzidos por ajuste fino na plataforma Model Studio. Modelos base e modelos de terceiros não são suportados.
- Modelos comprimidos não podem passar por novo ajuste fino nem por uma segunda compressão.
Crie uma tarefa de compressão
Pré-requisitos
Antes de usar o recurso de compressão de modelos, verifique se já existe um modelo personalizado ajustado na plataforma Model Studio disponível no workspace atual. Caso ainda não tenha concluído o ajuste fino do modelo, finalize primeiro o treinamento conforme descrito em Fine-tuning.
Procedimento
- Faça login no console do Model Studio. Na barra de navegação superior, selecione Model > Train > Model Compression.
- Na página de compressão de modelos, clique em Create Compression Task.
-
Na página de criação de tarefa de compressão, configure os seguintes parâmetros:

Parâmetro
Obrigatório
Descrição
Task Name
Sim
Até 50 caracteres. Recomenda-se incluir a abreviação do modelo, o método de quantização e o número da versão para facilitar o gerenciamento posterior.
Task Description
Não
Até 200 caracteres.
Source Model
Sim
Clique para abrir a caixa de diálogo de seleção de modelos, que exibe apenas modelos ajustados passíveis de compressão. Se nenhuma opção válida aparecer, conclua primeiro o treinamento de ajuste fino. Alterar o modelo de source limpa automaticamente o modelo de quantização selecionado, pois a lista de templates suportados varia entre modelos.
Output Model Name Suffix
Sim
Aceita apenas letras minúsculas e dígitos, com até 8 caracteres. Caracteres inválidos são filtrados automaticamente. Esse sufixo é anexado ao nome do modelo de source como identificador do modelo comprimido.
Quantization Template
Sim
Os templates disponíveis aparecem em formato de grade de cartões. Selecione um modelo de source antes de escolha um template. Um número maior de MU no nome do template indica uma especificação de implantação menor e custo reduzido.
Calibration Data
Condicionalmente obrigatório
Este campo aparece apenas quando o modelo de quantização selecionado inclui parâmetros de entrada de calibração. É possível selecione até 5 conjuntos de dados; conjuntos montados via oss não são suportados. Os conjuntos de dados devem ser criados e publicados em Data Management.
- Após confirme que a configuração está correta, clique em Start Compression. O botão fica habilitado somente depois que todos os campos obrigatórios forem preenchidos. Após a criação bem-sucedida, você será redirecionado automaticamente para a página da lista de tarefas.
Visualize progresso e logs da tarefa de compressão
Na página da lista de tarefas, clique no nome de uma tarefa para acesse a página de detalhes. Essa página contém duas abas: Details e Log.
Aba Details

- Informações básicas: id da tarefa (copiável), status de execução, horário de criação e duração da tarefa (atualizada em tempo real durante a execução). Em caso de falha, a mensagem de erro também é exibida.
- Configuração de compressão: Modelo de source, modelo comprimido, método de quantização, dados de calibração e outras definições estabelecidas no momento da criação.
Aba Log

- Linhas exibidas: Escolha exibir as 100, 500, 2.000 ou 5.000 linhas mais recentes dos logs.
- Atualização automática: Quando ativada, o conteúdo do log é atualizado automaticamente a cada 30 segundos.
- Coloração por nível de log: INFO (verde), DEBUG (cinza), ERROR (vermelho), WARN (amarelo).
- Operações de log: Permite baixar logs completos (sem limitação pela quantidade de linhas exibidas), recolher ou expandir subentradas, alternar entre modos escuro e claro, e ativar ou desativar a quebra de linha.
Solução de problemas de falha
Se uma tarefa de compressão falhar, siga estas etapas para diagnosticar o problema:
- Verifique a mensagem de erro na aba Details.
- Acesse a aba Log e busque por registros de nível ERROR.
- Baixe os logs completos para uma análise detalhada.
- Caso o problema persista, abra um ticket e anexe o id da tarefa e o arquivo de log.
Gerencie tarefas de compressão
No console, selecione Model > Train > Model Compression para acesse a página da lista de tarefas e gerencie as tarefas de compressão criadas.

Lista de tarefas
A lista de tarefas apresenta 7 colunas de informações:
Nome da coluna | Descrição |
|---|---|
Task Name/ID | Nome e id da tarefa. Clique no nome da tarefa para ir à página de detalhes. |
Quantization Template | Nome do modelo de quantização escolhido durante a criação da tarefa. |
Task Status | status atual de execução da tarefa. |
Source Model | Nome do modelo ajustado antes da compressão. |
Compressed Model | Nome do modelo gerado pela compressão. Clicável apenas quando a tarefa é bem-sucedida, redirecionando para o centro de modelos para visualize. |
Creation Time | Horário de criação da tarefa. |
Operation | Operações disponíveis, incluindo parar e exclua. A disponibilidade depende do status da tarefa. |
status da tarefa
As tarefas de compressão possuem 7 status no total. O ciclo de vida é o seguinte:
- PENDING (não iniciado): A tarefa foi criada e aguarda agendamento.
- QUEUING (na fila): A tarefa entrou na fila de execução.
- RUNNING (em execução): A compressão está sendo processada.
- SUCCEEDED (compressão bem-sucedida): A compressão foi concluída e o modelo foi gerado.
- FAILED (falha na compressão): Ocorreu um erro durante o processo.
- CANCELING (parando): O usuário solicitou a interrupção e a tarefa está sendo encerrada.
- CANCELED (cancelada): A tarefa foi interrompida pelo usuário.
Parar e exclua tarefas
- Parar uma tarefa: Apenas tarefas nos status PENDING e RUNNING podem ser interrompidas. Ao clique em Stop, confirme novamente na caixa de diálogo. Uma vez parada, a tarefa não pode ser recuperada. Também há um botão de parada disponível na página de detalhes.
- exclua uma tarefa: Somente tarefas em estados terminais (SUCCEEDED, FAILED, CANCELED) podem ser excluídas; tarefas com status QUEUING não permitem exclusão. exclua o registro da tarefa não afeta o modelo comprimido já produzido.
Faturamento
- A tarefa de compressão em si é gratuita por tempo limitado. O prazo final depende dos anúncios no console.
- O modelo comprimido é cobrado por especificação de MU durante a fase de implantação. Para detalhes sobre o faturamento de implantação, consulte Deployment.
FAQ
E se nenhum modelo estiver disponível ao crie uma tarefa de compressão?
E se nenhum modelo estiver disponível ao crie uma tarefa de compressão?
O modelo comprimido pode passar por novo ajuste fino ou ser recomprimido?
O modelo comprimido pode passar por novo ajuste fino ou ser recomprimido?
Qual a diferença entre quantização, poda e destilação?
Qual a diferença entre quantização, poda e destilação?
Como escolha um modelo de quantização?
Como escolha um modelo de quantização?
Como escolha os dados de calibração?
Como escolha os dados de calibração?
E se a precisão do modelo comprimido cair?
E se a precisão do modelo comprimido cair?
Como funciona o faturamento após o término do período gratuito?
Como funciona o faturamento após o término do período gratuito?
Como aproveitar o período gratuito para defina o melhor plano de compressão?
Como aproveitar o período gratuito para defina o melhor plano de compressão?