Skip to main content
Geração de Texto

Model compression

Compacte modelos usando técnicas como quantização para reduzir os custos de inferência.

Visão geral

A API de Model Compression compacta modelos personalizados ajustados com parâmetros completos por meio de técnicas como quantização, reduzindo o uso de memória durante a inferência e melhorando o throughput. Atualmente, o recurso de compressão suporta apenas quantização e abrange todo o ciclo de vida: consulta de templates, criação de tarefas, verificação de status, obtenção de logs e cancelamento ou exclusão de tarefas. Fluxo típico:
  • Liste os modelos quantizáveis e os templates de configuração → obtenha o template_id e o model quantizável
  • Crie uma tarefa de compressão → obtenha o job_id
  • Consulte periodicamente o status da tarefa de compressão ou obtenha os logs → aguarde até atingir SUCCEEDED / FAILED / CANCELED
  • Após o status SUCCEEDED, use quantized_output para criar um deployment; quando não for mais necessário, cancele ou exclua a tarefa de compressão
Domínio para todos os endpoints da API: https://dashscope-intl.aliyuncs.com. A autenticação utiliza uniformemente Authorization: Bearer ${YOUR_API_KEY}, e as requisições POST devem incluir Content-Type: application/json. Para entender o significado dos campos do objeto de tarefa e a máquina de estados, consulte Objeto de tarefa de compressão; para códigos de erro unificados, veja Error codes ao final do documento.

Início rápido

A API de compressão de modelos está disponível atualmente apenas na região Singapore. Se você utilizar outra região, realize as operações de compressão de modelos pelo console Bailian dessa região.
A API de compressão de modelos oferece um conjunto completo de interfaces RESTful que cobrem consulta de templates, criação de jobs, verificação de status, obtenção de logs e cancelamento ou exclusão de jobs. Este documento destina-se a desenvolvedores que desejam integrar capacidades de compressão via OpenAPI ou SDK. Para introduções sobre o console, consulte os documentos relacionados.

Pré-requisitos

Antes de chamar as interfaces deste documento, conclua as etapas a seguir:
  1. Ative o service Alibaba Cloud Bailian e conclua a verificação de nome real.
  2. O workspace atual deve ter pelo menos um modelo personalizado ajustado com parâmetros completos baseado em qwen3.5-flash-2026-02-23 (concluído via interface de job de ajuste fino). O recurso de compressão atual suporta apenas este modelo; modelos LoRA e modelos já quantizados não são suportados.
  3. Obtenha uma API Key (consulte Obtain API Key).
As especificações da unidade de deployment suportadas pelo modelo de saída compactado são determinadas pelo template de quantização selecionado, e a quantidade de deployments é configurada no console Bailian em "Model Deployment". O recurso de compressão atual é gratuito por tempo limitado.

Lista de interfaces

Domínios de todas as interfaces: https://dashscope-intl.aliyuncs.com

#

Método

Caminho

Descrição

1

GET

/api/v1/fine-tunes/compress/templates

Lista modelos quantizáveis e templates de configuração

2

POST

/api/v1/fine-tunes/compress/jobs

Cria job de compressão

3

GET

/api/v1/fine-tunes/compress/jobs

Lista jobs de compressão

4

GET

/api/v1/fine-tunes/compress/jobs/{job_id}

Consulta detalhes do job de compressão

5

GET

/api/v1/fine-tunes/compress/jobs/{job_id}/logs

Obtém logs do job de compressão

6

POST

/api/v1/fine-tunes/compress/jobs/{job_id}/cancel

Cancela job de compressão

7

DELETE

/api/v1/fine-tunes/compress/jobs/{job_id}

Exclui job de compressão

Autenticação

Todas as interfaces transmitem a API Key via HTTP Header:
Authorization: Bearer ${YOUR_API_KEY}
Content-Type: application/json aplica-se a cenários com corpo de requisição POST.

Comece em 5 minutos

  • HTTP
Instale a biblioteca requests:
pip install requests
Exemplo completo de criação de job, polling e obtenção do modelo de saída:
import requests, time

API_KEY = "YOUR_API_KEY"
BASE = "https://dashscope-intl.aliyuncs.com/api/v1/fine-tunes/compress"
HEADERS = {"Authorization": f"Bearer {API_KEY}", "Content-Type": "application/json"}

# 1. Create compression job
resp = requests.post(f"{BASE}/jobs", headers=HEADERS, json={
    "model": "qwen3.5-flash-2026-02-23-ft-***",  # Custom fine-tuned model ID
    "template_id": "quant-flash-nvfp4-mlp-nomtp",          # Obtain via GET /templates
    "output_model_suffix": "test",                          # Max 8 characters, lowercase letters and digits only
}).json()
job_id = resp["output"]["job_id"]
print("Job:", job_id)

# 2. Poll until terminal state
status = resp["output"]["status"]
while status not in ("SUCCEEDED", "FAILED", "CANCELED"):
    time.sleep(30)
    resp = requests.get(f"{BASE}/jobs/{job_id}", headers=HEADERS).json()
    status = resp["output"]["status"]
    print("Status:", status)

# 3. Process results
if status == "SUCCEEDED":
    print("Quantized model:", resp["output"]["quantized_output"])
    # Use quantized_output to call the model deployment interface for deployment
elif status == "FAILED":
    print("Error:", resp["output"]["error"])
Liste jobs e obtenha logs:
# List all successfully compressed jobs
resp = requests.get(f"{BASE}/jobs", headers=HEADERS, params={"status": "SUCCEEDED", "page_size": 20}).json()
for j in resp["output"]["jobs"]:
    print(j["job_id"], j["template_name"], j["quantized_output"])

# Get job logs
resp = requests.get(f"{BASE}/jobs/{job_id}/logs", headers=HEADERS, params={"offset": 0, "line": 100}).json()
for line in resp["output"]["logs"]:
    print(line)
Regras de nomenclatura do modelo de saída:
quantized_output = {base_model}-{output_model_suffix}-{job_id}
Por exemplo, se base_model for qwen3.5-flash-2026-02-23, suffix for test e job_id for quant-202604111200-a1b2, o ID do modelo de saída será:
qwen3.5-flash-2026-02-23-test-quant-202604111200-a1b2
Consulte a página de detalhes de cada interface para exemplos de uso com cURL.

Objeto de job de compressão

A API de compressão de modelos está disponível atualmente apenas na região Singapore. Se você utilizar outra região, realize a compressão de modelos no console Bailian dessa região.

Propriedades do objeto

Parâmetros de resposta

Campo

Tipo

Descrição

job_id

String

ID do job

job_name

String

Nome do job

job_description

String

Descrição do job

status

String

Status do job (consulte Status do job)

model

String

ID do modelo de source

base_model

String

ID do modelo base

template_id

String

ID do template de compressão em uso

template_name

String

Nome do template

template_description

String

Descrição do template

training_type

String

Tipo de job, fixo como quantization

compress_type

String

Tipo de compressão, igual a training_type, fixo como quantization

hyper_parameters

Object

Hiperparâmetros efetivamente aplicados (retorna apenas parâmetros visíveis ao usuário)

custom_calibration_file_ids

Array<String>

Lista de IDs de arquivo do conjunto de dados de calibração personalizado

quantized_output

String

ID do modelo gerado após a quantização (possui valor apenas quando SUCCEEDED)

create_time

String

Horário de criação do job

start_time

String

Horário de início da execução do job (nulo quando PENDING/QUEUING)

end_time

String

Horário de conclusão do job (possui valor em estados terminais)

error

Object

Informações de erro em caso de falha, contendo code e message; nulo em caso de sucesso

group

String

Grupo do job, fixo como quantization

usage

Integer

Duração da GPU (segundos), aparece quando SUCCEEDED ou CANCELED

Status do job

Status

Descrição

PENDING

Job criado, aguardando agendamento

QUEUING

Entrou na fila de agendamento, aguardando recursos de GPU

RUNNING

Job em andamento

CANCELING

Cancelamento iniciado, aguardando encerramento

SUCCEEDED

Job concluído com sucesso, o campo quantized_output retorna o ID do modelo gerado

FAILED

Job falhou, os campos error.code / error.message retornam o motivo

CANCELED

Job cancelado

Transição de status:
PENDING ─→ QUEUING ─→ RUNNING ─→ SUCCEEDED
                  │           │
                  ↓           ↓
                CANCELING ─→ FAILED / CANCELED

Listar modelos quantizáveis e templates de configuração

Lista todos os modelos personalizados ajustados quantizáveis do usuário atual, bem como os templates de compressão vinculados a cada modelo. Os templates são vinculados aos modelos base; diferentes combinações de arquitetura de modelo × precisão × especificações de MU alvo correspondem a diferentes templates.
Retorna apenas modelos personalizados que o usuário atual ajustou completamente (SFT/DPO/CPT) com base em um modelo base. Modelos ajustados com LoRA e modelos já quantizados não aparecerão nos resultados.
Endpoint
GET /api/v1/fine-tunes/compress/templates
Parâmetros de requisição

Parâmetro

Tipo

Obrigatório

Padrão

Descrição

model

String

Não

-

Filtra por ID de modelo; ao passar um nome de modelo base, retorna todos os modelos personalizados baseados nesse modelo base

lang

String

Não

zh-CN

Idioma da resposta: zh-CN / en-US (consulte Suporte a múltiplos idiomas)

Exemplo de requisição
curl "https://dashscope-intl.aliyuncs.com/api/v1/fine-tunes/compress/templates" \
  -H "Authorization: Bearer ${API_KEY}"
Exemplo de resposta (mínimo)
{
  "request_id": "uuid-string",
  "output": {
    "base_models": ["qwen3.5-flash-2026-02-23"],
    "custom_models": [
      {
        "model": "qwen3.5-flash-2026-02-23-ft-***",
        "model_name": "My SFT fine-tuned model",
        "base_model": "qwen3.5-flash-2026-02-23",
        "templates": [
          {
            "template_id": "quant-flash-nvfp4-mlp-nomtp",
            "template_name": "W4A4 NVFP4 high-performance compression-MU5/MU8/MU9",
            "description": "Balances high precision and high performance under lower-bit compression, further reducing memory usage and improving inference throughput.",
            "compress_type": "quantization",
            "hyper_parameters": []
          }
        ]
      }
    ]
  }
}
{
  "request_id": "uuid-string",
  "output": {
    "base_models": ["qwen3.5-flash-2026-02-23"],
    "custom_models": [
      {
        "model": "qwen3.5-flash-2026-02-23-ft-***",
        "model_name": "My SFT fine-tuned model",
        "base_model": "qwen3.5-flash-2026-02-23",
        "templates": [
          {
            "template_id": "quant-flash-nvfp4-mlp-nomtp",
            "template_name": "W4A4 NVFP4 high-performance compression-MU5/MU8/MU9",
            "description": "Balances high precision and high performance under lower-bit compression, further reducing memory usage and improving inference throughput.",
            "compress_type": "quantization",
            "hyper_parameters": [
              {
                "name": "calib_input",
                "type": "string",
                "display_name": "Calibration input",
                "description": "Whether to enable calibration input",
                "support_values": ["true"],
                "defaultValue": "true",
                "recommend_value": "true",
                "required": false
              }
            ]
          }
        ]
      }
    ]
  }
}
Parâmetros de resposta

Campo

Tipo

Descrição

base_models

Array<String>

Lista de nomes de modelos base que suportam compressão

custom_models[].model

String

ID do modelo

custom_models[].model_name

String

Nome de exibição do modelo

custom_models[].base_model

String

Nome do modelo base

custom_models[].templates

Array

Lista de templates de configuração de compressão suportados por este modelo, herdados dos templates de seu modelo base

templates[].template_id

String

ID do template, passado como parâmetro template_id ao criar uma tarefa de compressão

templates[].template_name

String

Nome do template (suporta múltiplos idiomas; retorna a versão correspondente ao idioma com base no parâmetro lang)

templates[].description

String

Descrição do template (suporta múltiplos idiomas; retorna a versão correspondente ao idioma com base no parâmetro lang)

templates[].compress_type

String

Tipo de compressão, fixo como quantization

templates[].hyper_parameters

Array

Hiperparâmetros ajustáveis; um array vazio indica que não há hiperparâmetros ajustáveis

hyper_parameters[].name

String

Nome do parâmetro (usado como chave ao criar uma tarefa)

hyper_parameters[].type

String

Tipo: number (numérico, usado com data_range/step) / string (enumeração, usado com support_values)

hyper_parameters[].display_name

String

Nome de exibição do parâmetro (suporta múltiplos idiomas; retorna a versão correspondente ao idioma com base no parâmetro lang)

hyper_parameters[].description

String

Descrição do parâmetro (suporta múltiplos idiomas; retorna a versão correspondente ao idioma com base no parâmetro lang)

hyper_parameters[].defaultValue

String

Valor padrão

hyper_parameters[].recommend_value

String

Valor recomendado

hyper_parameters[].required

Boolean

Se é obrigatório

hyper_parameters[].support_values

Array<String>

Lista de valores de enumeração (presente apenas quando type=string), ex.: ["instruct", "think", "hybrid"]

hyper_parameters[].data_range

Array<String>

Faixa numérica (presente apenas quando type=number), ex.: ["64","256"] indica uma faixa de 64 a 256

hyper_parameters[].step

Integer

Tamanho do passo (presente apenas quando type=number)

Criar um job de compressão

Endpoint
POST /api/v1/fine-tunes/compress/jobs
Parâmetros de requisição

Parâmetro

Tipo

Obrigatório

Padrão

Descrição

model

String

Sim

-

ID do modelo de source, obtido via API

template_id

String

Sim

-

ID do template de compressão, obtido via API

job_name

String

Não

Gerado automaticamente

Nome do job; duplicatas não são permitidas para o mesmo usuário; até 50 caracteres

job_description

String

Não

-

Descrição do job; até 200 caracteres

hyper_parameters

Object

Não

Valor padrão do template

Substituições de hiperparâmetros (chave-valor); passe apenas os itens que deseja substituir

custom_calibration_file_ids

Array<String>

Não

-

Lista de IDs de arquivo do conjunto de dados de calibração personalizado (ID do grupo de conjunto de dados, no formato file-{32hex}); entra em vigor apenas quando calib_input=true. O conjunto de dados deve ser criado e publicado primeiro em Data Management

output_model_suffix

String

Não

-

Sufixo do nome do modelo de saída quantizado; até 8 caracteres, apenas letras minúsculas e dígitos. Formato do nome do modelo de saída: {base_model}-{suffix}-{job_id}

Exemplo de requisição
curl -X POST "https://dashscope-intl.aliyuncs.com/api/v1/fine-tunes/compress/jobs" \
  -H "Authorization: Bearer ${API_KEY}" \
  -H "Content-Type: application/json" \
  -d '{
    "job_name": "qwen3.5-flash compression job",
    "model": "qwen3.5-flash-2026-02-23-ft-***",
    "template_id": "quant-flash-nvfp4-mlp-nomtp",
    "custom_calibration_file_ids": ["file-***"],
    "output_model_suffix": "test"
  }'
Exemplo de resposta
{
  "request_id": "uuid-string",
  "output": {
    "job_id": "quant-202604111200-a1b2",
    "job_name": "qwen3.5-flash compression job",
    "status": "PENDING",
    "model": "qwen3.5-flash-2026-02-23-ft-***",
    "base_model": "qwen3.5-flash-2026-02-23",
    "template_id": "quant-flash-nvfp4-mlp-nomtp",
    "template_name": "W4A4 NVFP4 high-performance compression-MU5/MU8/MU9",
    "training_type": "quantization",
    "compress_type": "quantization",
    "hyper_parameters": {},
    "custom_calibration_file_ids": ["file-***"],
    "quantized_output": null,
    "create_time": "2026-04-11 12:00:00",
    "start_time": null,
    "end_time": null,
    "error": null,
    "group": "quantization"
  }
}
Parâmetros de resposta: Os significados dos campos são os mesmos dos parâmetros de requisição.

Listar jobs de compressão

Suporta filtragem por status, modelo, template, especificação de quantização, algoritmo, intervalo de tempo, nome/ID do job, além de ordenação por horário de criação e paginação. Endpoint
GET /api/v1/fine-tunes/compress/jobs
Parâmetros de requisição

Parâmetro

Tipo

Obrigatório

Padrão

Descrição

status

String

Não

-

Filtra por status (ex.: RUNNING, SUCCEEDED)

model

String

Não

-

Filtra por ID do modelo de source

template_id

String

Não

-

Filtra por ID do template

quant_spec

String

Não

-

Filtra por especificação de quantização (ex.: w4a16, w8a8)

quant_method

String

Não

-

Filtra por algoritmo de quantização (ex.: gptq, awq, fp8)

start_time

String

Não

-

O horário de início do job não é anterior a este valor. Formato: yyyy-MM-dd HH:mm:ss / ISO-8601 / yyyy-MM-dd

end_time

String

Não

-

O horário de término do job não é posterior a este valor, formato igual a start_time

job_name

String

Não

-

Correspondência aproximada por nome do job

job_id

String

Não

-

Correspondência aproximada por ID do job

search_key

String

Não

-

Palavra-chave de busca. Quando select_key não é fornecido, busca aproximadamente tanto em job_id quanto em job_name; quando combinado com select_key, apenas o campo especificado é buscado

select_key

String

Não

-

Campo de busca para search_key, opções: job_id / job_name

sort_by

String

Não

create_time

Campo de ordenação, atualmente suporta apenas create_time

sort_order

String

Não

desc

Direção da ordenação, asc ascendente / desc descendente

page_no

Integer

Não

1

Número da página

page_size

Integer

Não

10

Tamanho da página, máximo 100

Exemplos de requisição
# Combined search: by status + algorithm + pagination
curl "https://dashscope-intl.aliyuncs.com/api/v1/fine-tunes/compress/jobs?status=SUCCEEDED&quant_method=gptq&page_size=10" \
  -H "Authorization: Bearer ${API_KEY}"

# Time range + search by job name + ascending by create time
curl "https://dashscope-intl.aliyuncs.com/api/v1/fine-tunes/compress/jobs?start_time=2026-04-01&end_time=2026-04-30&search_key=qwen3&select_key=job_name&sort_by=create_time&sort_order=asc" \
  -H "Authorization: Bearer ${API_KEY}"
Exemplo de resposta
{
  "request_id": "uuid-string",
  "output": {
    "total": 42,
    "page_no": 1,
    "page_size": 10,
    "jobs": [
      {
        "job_id": "quant-202604111200-a1b2",
        "job_name": "qwen3.5-flash compression job",
        "status": "SUCCEEDED",
        "model": "qwen3.5-flash-2026-02-23-ft-***",
        "base_model": "qwen3.5-flash-2026-02-23",
        "template_id": "quant-flash-nvfp4-mlp-nomtp",
        "template_name": "W4A4 NVFP4 high-performance compression-MU5/MU8/MU9",
        "training_type": "quantization",
        "compress_type": "quantization",
        "custom_calibration_file_ids": ["file-***"],
        "quantized_output": "qwen3.5-flash-2026-02-23-test-quant-202604111200-a1b2",
        "create_time": "2026-04-11 12:00:00",
        "start_time": "2026-04-11 12:02:30",
        "end_time": "2026-04-11 13:02:30",
        "group": "quantization",
        "usage": 3600
      }
    ]
  }
}
Parâmetros de resposta

Campo

Tipo

Descrição

total

Integer

Número total de jobs correspondentes

page_no

Integer

Número da página atual

page_size

Integer

Tamanho da página

jobs

Array

Lista de jobs, os significados dos campos são os mesmos dos parâmetros de resposta da criação de job de compressão

Consultar um job de compressão

Endpoint
GET /api/v1/fine-tunes/compress/jobs/{job_id}
Exemplo de requisição
curl "https://dashscope-intl.aliyuncs.com/api/v1/fine-tunes/compress/jobs/quant-202604111200-a1b2" \
  -H "Authorization: Bearer ${API_KEY}"
Exemplo de resposta
{
  "request_id": "uuid-string",
  "output": {
    "job_id": "quant-202604111200-a1b2",
    "job_name": "qwen3.5-flash compression job",
    "job_description": "...",
    "status": "SUCCEEDED",
    "model": "qwen3.5-flash-2026-02-23-ft-***",
    "base_model": "qwen3.5-flash-2026-02-23",
    "template_id": "quant-flash-nvfp4-mlp-nomtp",
    "template_name": "W4A4 NVFP4 high-performance compression-MU5/MU8/MU9",
    "template_description": "Maintains high accuracy and high performance under lower-bit compression, further reducing GPU memory usage and improving inference throughput.",
    "training_type": "quantization",
    "compress_type": "quantization",
    "hyper_parameters": {},
    "custom_calibration_file_ids": ["file-***"],
    "quantized_output": "qwen3.5-flash-2026-02-23-test-quant-202604111200-a1b2",
    "create_time": "2026-04-11 12:00:00",
    "start_time": "2026-04-11 12:02:30",
    "end_time": "2026-04-11 13:02:30",
    "error": null,
    "group": "quantization",
    "usage": 3600
  }
}
Parâmetros de resposta

Campo

Tipo

Descrição

job_id

String

ID do job, obtido via interface de criação ou listagem de jobs de compressão

job_name

String

Nome do job

job_description

String

Descrição do job

status

String

Status do job (consulte Status do job para detalhes)

model

String

ID do modelo de source

base_model

String

ID do modelo base

template_id

String

ID do template de compressão utilizado

template_name

String

Nome do template

template_description

String

Descrição do template

training_type

String

Tipo de job, fixo como quantization

compress_type

String

Tipo de compressão, igual a training_type, fixo como quantization

hyper_parameters

Object

Hiperparâmetros efetivamente aplicados (retorna apenas parâmetros visíveis ao usuário)

custom_calibration_file_ids

Array<String>

Lista de IDs de arquivo do conjunto de dados de calibração personalizado

quantized_output

String

ID do modelo gerado após a quantização (possui valor apenas quando SUCCEEDED), pode ser usado pela interface Create deployment para deployment do modelo

create_time

String

Horário de criação do job

start_time

String

Horário de início da execução do job (nulo quando PENDING/QUEUING)

end_time

String

Horário de conclusão do job (possui valor em estados terminais)

error

Object

Informações de erro em caso de falha, contendo code e message; nulo em caso de sucesso

group

String

Grupo do job, fixo como quantization

usage

Integer

Duração da GPU (segundos), presente quando SUCCEEDED ou CANCELED

Obter logs do job de compressão

Endpoint
GET /api/v1/fine-tunes/compress/jobs/{job_id}/logs
Onde {job_id} é o ID do job de compressão, obtido via interface de criação ou listagem de jobs de compressão. Parâmetros de requisição

Parâmetro

Tipo

Obrigatório

Padrão

Descrição

offset

Integer

Não

0

Ignora as primeiras N linhas e começa a leitura a partir da linha (N+1)

line

Integer

Não

100

Número de linhas a ler, até 1000

Exemplo de requisição
curl "https://dashscope-intl.aliyuncs.com/api/v1/fine-tunes/compress/jobs/quant-202604111200-a1b2/logs?offset=0&line=50" \
	-H "Authorization: Bearer ${API_KEY}"
Exemplo de resposta
{
  "request_id": "uuid-string",
  "output": {
    "total": 15,
    "logs": [
      "2026-04-11 12:02:35 - INFO - Starting quantization...",
      "2026-04-11 12:30:00 - INFO - Quantization progress: 100%",
      "2026-04-11 12:35:00 - INFO - Quantization succeeded!"
    ]
  }
}
Regras de exibição de logs
  • Quando um conjunto de dados de calibração personalizado é fornecido para o job, os logs contêm um marcador de conclusão de processamento de dados data process succeeded, start to quantization
  • A interface de logs filtra marcadores internos do sistema e retorna apenas informações legíveis sobre o progresso da compressão

Cancelar um job de compressão

É possível cancelar apenas jobs nos estados PENDING, QUEUING ou RUNNING. O cancelamento é uma operação assíncrona. O job entra primeiro no estado transitório CANCELING e eventualmente torna-se CANCELED. Endpoint
POST /api/v1/fine-tunes/compress/jobs/{job_id}/cancel
Onde {job_id} é o ID do job de compressão, obtido via API de criação ou listagem de jobs de compressão. Exemplo de requisição
curl -X POST "https://dashscope-intl.aliyuncs.com/api/v1/fine-tunes/compress/jobs/quant-202604111200-a1b2/cancel" \
  -H "Authorization: Bearer ${API_KEY}"
Exemplo de resposta
{
  "request_id": "uuid-string",
  "output": { "status": "success" }
}

Excluir um job de compressão

É possível excluir apenas jobs em estado terminal (SUCCEEDED / FAILED / CANCELED). Excluir o registro do job não exclui o modelo quantizado já gerado (quantized_output). Endpoint
DELETE /api/v1/fine-tunes/compress/jobs/{job_id}
Onde {job_id} é o ID do job de compressão, obtido via API de criação ou listagem de jobs de compressão. Exemplo de requisição
curl -X DELETE "https://dashscope-intl.aliyuncs.com/api/v1/fine-tunes/compress/jobs/quant-202604111200-a1b2" \
  -H "Authorization: Bearer ${API_KEY}"
Exemplo de resposta
{
  "request_id": "uuid-string",
  "output": { "status": "success" }
}

Código de erro

Códigos de erro comuns

Código de erro

HTTP

Descrição

InvalidParameter

400

Parâmetro de requisição inválido

MissingParameter

400

Parâmetro obrigatório ausente

Unauthorized

401

Falha na autenticação

Forbidden

403

Sem permissão de acesso

ResourceNotFound

404

Recurso não existe

UnsupportedOperation

400

O estado do recurso não permite esta operação (ex.: cancelar um job que já está em estado terminal)

QuotaExceeded

429

Cota excedida

InternalError

500

Erro interno do service

Códigos de erro de negócio

Os seguintes códigos de erro de negócio estão listados por cenário. External Code é o valor real do campo code retornado pela interface. Validação de parâmetros

External Code

HTTP

Descrição

InvalidParameter

400

Parâmetro obrigatório ausente model

InvalidParameter

400

Parâmetro obrigatório ausente template_id

InvalidParameter

400

Quantização direta de modelos base não é suportada

InvalidParameter

400

O template de configuração especificado não existe

InvalidParameter

400

O modelo atual não suporta este template de compressão

InvalidParameter

400

O modelo não suporta quantização

InvalidParameter

400

Modelos ajustados com LoRA não suportam quantização

InvalidParameter

400

Dados do modelo indisponíveis

InvalidParameter

400

O nome do job contém caracteres não suportados

InvalidParameter

400

output_model_suffix excede 8 caracteres

InvalidParameter

400

O modelo de source não está pronto

AccessDenied

403

Sem permissão para usar este template de compressão

Validação de hiperparâmetros

External Code

HTTP

Descrição

InvalidParameter

400

Hiperparâmetro obrigatório não fornecido

InvalidParameter

400

Hiperparâmetro desconhecido fornecido

InvalidParameter

400

O valor do hiperparâmetro não está na lista de enumeração

InvalidParameter

400

O valor do hiperparâmetro está fora da faixa permitida

InvalidParameter

400

O valor do hiperparâmetro não é um número válido

Consulta de job

External Code

HTTP

Descrição

NotFound

404

O job de compressão especificado não existe

InvalidParameter

400

Parâmetro obrigatório ausente job_id

Parâmetros de paginação e tempo

External Code

HTTP

Descrição

InvalidParameter

400

Parâmetro de número de página inválido (deve ser ≥ 1)

InvalidParameter

400

Tamanho de página inválido (deve ser 1–100)

InvalidParameter

400

Formato de tempo inválido

Exemplo de resposta de erro

{
  "request_id": "uuid-string",
  "code": "InvalidParameter",
  "message": "The specified model 'xxx-lora-yyy' is a LoRA model and not supported for quantization."
}
Referência da API de Geração de Texto
Geração de Imagens
  • FAQ
Geração de Vídeo
Áudio
API em tempo real
Incorporação de Texto
Produção de Modelos