Skip to main content
Compressão de Modelos

Model compression

A compressão de modelos utiliza quantização para converter um modelo ajustado de precisão total em uma versão de baixa precisão, reduzindo a especificação de MU e o custo necessário para implantação. Este tópico descreve como crie e gerencie tarefas de compressão de modelos no console.

Visão geral do recurso

A compressão de modelos emprega quantização para transformar um modelo ajustado de precisão total em uma versão de baixa precisão. Esse processo diminui a especificação de MU exigida na implantação e preserva as capacidades do modelo, o que reduz os custos de implantação de inferência. Na plataforma Model Studio, a compressão de modelos refere-se especificamente à quantização e não envolve poda estrutural ou destilação de conhecimento. A compressão é uma etapa opcional no pipeline de produção de modelos. O pipeline completo é: Fine-tuning → Compressão de modelos → Deployment. Primeiro, conclua o treinamento de ajuste fino; em seguida, comprima o modelo ajustado resultante e, por fim, implante o modelo comprimido como um service de inferência.
A compressão é irreversível. Um modelo comprimido não pode ser submetido a novo ajuste fino nem comprimido uma segunda vez. Confirme o modelo de quantização antes de iniciar a compressão.

Modelos suportados

A tabela abaixo lista os modelos com suporte atual para compressão. Consulte o console para obter a lista definitiva.

Série de modelos

Modelo base

Especificação de implantação antes da compressão

Especificação de implantação após a compressão

Qwen

qwen3.5-flash-2026-02-23

MU1*2(¥108/hour)

MU8*1(¥47/hour)

No exemplo acima, o custo de implantação após a compressão é aproximadamente 56% menor do que antes da compressão.

Limites de uso

  • Disponível apenas na região North China 2 (Beijing).
  • Suporta apenas modelos personalizados produzidos por ajuste fino na plataforma Model Studio. Modelos base e modelos de terceiros não são suportados.
  • Modelos comprimidos não podem passar por novo ajuste fino nem por uma segunda compressão.

Crie uma tarefa de compressão

Pré-requisitos

Antes de usar o recurso de compressão de modelos, verifique se já existe um modelo personalizado ajustado na plataforma Model Studio disponível no workspace atual. Caso ainda não tenha concluído o ajuste fino do modelo, finalize primeiro o treinamento conforme descrito em Fine-tuning.

Procedimento

  1. Faça login no console do Model Studio. Na barra de navegação superior, selecione Model > Train > Model Compression.
  2. Na página de compressão de modelos, clique em Create Compression Task.
  3. Na página de criação de tarefa de compressão, configure os seguintes parâmetros:
    image

    Parâmetro

    Obrigatório

    Descrição

    Task Name

    Sim

    Até 50 caracteres. Recomenda-se incluir a abreviação do modelo, o método de quantização e o número da versão para facilitar o gerenciamento posterior.

    Task Description

    Não

    Até 200 caracteres.

    Source Model

    Sim

    Clique para abrir a caixa de diálogo de seleção de modelos, que exibe apenas modelos ajustados passíveis de compressão. Se nenhuma opção válida aparecer, conclua primeiro o treinamento de ajuste fino. Alterar o modelo de source limpa automaticamente o modelo de quantização selecionado, pois a lista de templates suportados varia entre modelos.

    Output Model Name Suffix

    Sim

    Aceita apenas letras minúsculas e dígitos, com até 8 caracteres. Caracteres inválidos são filtrados automaticamente. Esse sufixo é anexado ao nome do modelo de source como identificador do modelo comprimido.

    Quantization Template

    Sim

    Os templates disponíveis aparecem em formato de grade de cartões. Selecione um modelo de source antes de escolha um template. Um número maior de MU no nome do template indica uma especificação de implantação menor e custo reduzido.

    Calibration Data

    Condicionalmente obrigatório

    Este campo aparece apenas quando o modelo de quantização selecionado inclui parâmetros de entrada de calibração. É possível selecione até 5 conjuntos de dados; conjuntos montados via oss não são suportados. Os conjuntos de dados devem ser criados e publicados em Data Management.

  4. Após confirme que a configuração está correta, clique em Start Compression. O botão fica habilitado somente depois que todos os campos obrigatórios forem preenchidos. Após a criação bem-sucedida, você será redirecionado automaticamente para a página da lista de tarefas.
Não é possível modificar a configuração de uma tarefa de compressão após sua criação. Verifique cuidadosamente a seleção do modelo de quantização antes de clique em Start Compression.

Visualize progresso e logs da tarefa de compressão

Na página da lista de tarefas, clique no nome de uma tarefa para acesse a página de detalhes. Essa página contém duas abas: Details e Log.

Aba Details

image
A aba Details exibe as seguintes informações:
  • Informações básicas: id da tarefa (copiável), status de execução, horário de criação e duração da tarefa (atualizada em tempo real durante a execução). Em caso de falha, a mensagem de erro também é exibida.
  • Configuração de compressão: Modelo de source, modelo comprimido, método de quantização, dados de calibração e outras definições estabelecidas no momento da criação.

Aba Log

image
Acesse a aba Log para visualize os logs de execução da tarefa de compressão.
  • Linhas exibidas: Escolha exibir as 100, 500, 2.000 ou 5.000 linhas mais recentes dos logs.
  • Atualização automática: Quando ativada, o conteúdo do log é atualizado automaticamente a cada 30 segundos.
  • Coloração por nível de log: INFO (verde), DEBUG (cinza), ERROR (vermelho), WARN (amarelo).
  • Operações de log: Permite baixar logs completos (sem limitação pela quantidade de linhas exibidas), recolher ou expandir subentradas, alternar entre modos escuro e claro, e ativar ou desativar a quebra de linha.

Solução de problemas de falha

Se uma tarefa de compressão falhar, siga estas etapas para diagnosticar o problema:
  1. Verifique a mensagem de erro na aba Details.
  2. Acesse a aba Log e busque por registros de nível ERROR.
  3. Baixe os logs completos para uma análise detalhada.
  4. Caso o problema persista, abra um ticket e anexe o id da tarefa e o arquivo de log.

Gerencie tarefas de compressão

No console, selecione Model > Train > Model Compression para acesse a página da lista de tarefas e gerencie as tarefas de compressão criadas.
image

Lista de tarefas

A lista de tarefas apresenta 7 colunas de informações:

Nome da coluna

Descrição

Task Name/ID

Nome e id da tarefa. Clique no nome da tarefa para ir à página de detalhes.

Quantization Template

Nome do modelo de quantização escolhido durante a criação da tarefa.

Task Status

status atual de execução da tarefa.

Source Model

Nome do modelo ajustado antes da compressão.

Compressed Model

Nome do modelo gerado pela compressão. Clicável apenas quando a tarefa é bem-sucedida, redirecionando para o centro de modelos para visualize.

Creation Time

Horário de criação da tarefa.

Operation

Operações disponíveis, incluindo parar e exclua. A disponibilidade depende do status da tarefa.

Filtre e pesquise por Quantization Template, Task Status (5 tipos), time range e task name or ID. A lista permite ordenação e exibe 10 registros por página.

status da tarefa

As tarefas de compressão possuem 7 status no total. O ciclo de vida é o seguinte:
  • PENDING (não iniciado): A tarefa foi criada e aguarda agendamento.
  • QUEUING (na fila): A tarefa entrou na fila de execução.
  • RUNNING (em execução): A compressão está sendo processada.
  • SUCCEEDED (compressão bem-sucedida): A compressão foi concluída e o modelo foi gerado.
  • FAILED (falha na compressão): Ocorreu um erro durante o processo.
  • CANCELING (parando): O usuário solicitou a interrupção e a tarefa está sendo encerrada.
  • CANCELED (cancelada): A tarefa foi interrompida pelo usuário.

Parar e exclua tarefas

  • Parar uma tarefa: Apenas tarefas nos status PENDING e RUNNING podem ser interrompidas. Ao clique em Stop, confirme novamente na caixa de diálogo. Uma vez parada, a tarefa não pode ser recuperada. Também há um botão de parada disponível na página de detalhes.
  • exclua uma tarefa: Somente tarefas em estados terminais (SUCCEEDED, FAILED, CANCELED) podem ser excluídas; tarefas com status QUEUING não permitem exclusão. exclua o registro da tarefa não afeta o modelo comprimido já produzido.
Mensagem de estado vazio: Quando não há tarefas, a página exibe um texto orientativo e oferece um acesso para criação; quando há resultados de filtro, aparece a mensagem "No matches found", sugerindo ajustar as condições de filtro ou limpar a pesquisa.

Faturamento

  • A tarefa de compressão em si é gratuita por tempo limitado. O prazo final depende dos anúncios no console.
  • O modelo comprimido é cobrado por especificação de MU durante a fase de implantação. Para detalhes sobre o faturamento de implantação, consulte Deployment.
Tomando como exemplo o modelo ajustado qwen3.5-flash-2026-02-23, veja as especificações de implantação e preços antes e depois da compressão em Supported models. Os custos de implantação são reduzidos em aproximadamente 56%. Recomendamos comparar os efeitos de compressão de vários modelos de quantização durante o período gratuito e selecione o plano ideal antes da implantação formal.

FAQ

A caixa de diálogo de seleção de modelo de source exibe apenas modelos ajustados passíveis de compressão. Se não houver opções selecionáveis, significa que o workspace atual não possui um modelo ajustado qualificado. Consulte Fine-tuning para concluir o treinamento de ajuste fino e garanta que o status do treinamento seja bem-sucedido antes de crie uma tarefa de compressão.
Não. A compressão é uma operação unidirecional. Se precisar fazer ajustes, reinicie a compressão a partir do modelo ajustado de precisão total original. Para mais detalhes, consulte as restrições de uso em Feature overview.
São três técnicas distintas de otimização de modelos. A quantização reduz a precisão dos parâmetros, a poda remove estruturas redundantes e a destilação usa um modelo grande para treinar um modelo menor. Atualmente, o Model Studio suporta apenas quantização.
O modelo de quantização determina a especificação de implantação do modelo comprimido. Quanto maior o número de MU no nome do template, menor a especificação de implantação e o custo, porém maior a possível perda de precisão. Recomendamos escolha um template com base no equilíbrio entre custo e precisão adequado ao seu negócio. Em caso de dúvida, teste vários templates durante o período gratuito e valide os efeitos usando um conjunto de testes de negócios após a implantação.
Os dados de calibração servem para melhorar a precisão da quantização. Recomendamos escolha um conjunto de dados semanticamente semelhante ao cenário de inferência alvo. Por exemplo, se o modelo comprimido for usado em um cenário de perguntas e respostas de atendimento ao cliente, utilize um conjunto de dados contendo amostras de diálogos desse contexto como dados de calibração.
A compressão por quantização pode causar algum grau de perda de precisão. Recomendamos usar um conjunto de testes de negócios para realizar a verifique de inferência após a implantação. Se a precisão não atender às suas necessidades, tente alterar o modelo de quantização e comprimir novamente, ou adicione dados de calibração para melhorar a qualidade da quantização.
As tarefas de compressão estão gratuitas por tempo limitado. O método de cobrança após o fim do período gratuito dependerá dos anúncios no console. A taxa de implantação do modelo comprimido não é afetada pelo período gratuito e continua sendo cobrada por especificação de MU.
Recomendamos testar vários modelos de quantização no mesmo modelo ajustado durante o período gratuito, implantá-los separadamente e verifique os efeitos de inferência com um conjunto de testes de negócios. Compare o desempenho dos diferentes templates em termos de precisão e custo, e selecione o plano que melhor se adapta às necessidades do seu negócio antes da entrada em produção.
Para gerencie tarefas de compressão via API, consulte Model compression API reference.
Plano de Tokens
Playground de Modelos
  • Music generation
Inferência do Modelo
Avaliação
Compressão de Modelos
Estatísticas e Monitoramento
Suporte