Skip to main content
Geração de Texto

qwen3-max

O modelo Max da série Qwen 3 recebeu atualizações especializadas em programação de agentes e invocação de ferramentas em comparação com a versão preview. O modelo lançado oficialmente alcançou desempenho state-of-the-art (SOTA) em sua categoria e atende melhor às demandas de agentes que operam em cenários mais complexos. Esta versão do modelo é funcionalmente equivalente ao modelo snapshot qwen3-max-2026-01-23.

Provedor de service de inferência

O Alibaba Cloud Model Studio fornece o service de inferência para qwen3-max.

Capacidades do modelo

  • China (Beijing)
  • Singapore
  • Germany (Frankfurt)
  • US (Virginia)
  • Hong Kong (China)

Capacidade

Suporte

Capacidade

Suporte

Modalidade de entrada

Text

Modalidade de saída

Text

Experiência do modelo

Supported

Function Calling

Supported

Saídas estruturadas

Supported

Busca na web

Supported

Conclusão de prefixo

Supported

Cache de contexto

Supported

Inferência em lote

Supported

Fine-tuning

Unsupported

Limites de contexto

Parâmetro

Valor

Parâmetro

Valor

Comprimento máximo de entrada

258048

Comprimento máximo de saída

65536

Janela de contexto

262144

Comprimento máximo de entrada (Modo de raciocínio)

258048

Comprimento máximo de saída (Modo de raciocínio)

32768

Comprimento máximo da cadeia de pensamento

81920

Preços

Esta página exibe apenas os preços originais para chamadas de API do modelo, sem incluir promoções por tempo limitado. Acesse o Model Studio Console para consultar ofertas promocionais.
  • China (Beijing)
  • Singapore
  • Germany (Frankfurt)
  • US (Virginia)
  • Hong Kong (China)

Item de faturamento

Preço (USD)

Unidade

Entrada

0,359

Por 1M tokens

Saída

1,434

Por 1M tokens

Entrada (Cache implícito)

0,072

Por 1M tokens

Entrada (Arquivo em lote)

0,18

Por 1M tokens

Saída (Arquivo em lote)

0,717

Por 1M tokens

Criação de cache explícito

0,448

Por 1M tokens

Leitura de cache explícito

0,036

Por 1M tokens

Entrada (Chat em lote)

0,359

Por 1M tokens

Saída (Chat em lote)

1,434

Por 1M tokens

Item de faturamento

Preço (USD)

Unidade

Entrada

0,574

Por 1M tokens

Saída

2,294

Por 1M tokens

Entrada (Cache implícito)

0,115

Por 1M tokens

Entrada (Arquivo em lote)

0,287

Por 1M tokens

Saída (Arquivo em lote)

1,147

Por 1M tokens

Criação de cache explícito

0,717

Por 1M tokens

Leitura de cache explícito

0,058

Por 1M tokens

Entrada (Chat em lote)

0,574

Por 1M tokens

Saída (Chat em lote)

2,294

Por 1M tokens

Item de faturamento

Preço (USD)

Unidade

Entrada

1,004

Por 1M tokens

Saída

4,014

Por 1M tokens

Entrada (Cache implícito)

0,201

Por 1M tokens

Entrada (Arquivo em lote)

0,502

Por 1M tokens

Saída (Arquivo em lote)

2,007

Por 1M tokens

Criação de cache explícito

1,255

Por 1M tokens

Leitura de cache explícito

0,101

Por 1M tokens

Entrada (Chat em lote)

1,004

Por 1M tokens

Saída (Chat em lote)

4,014

Por 1M tokens

Limites de taxa

  • China (Beijing)
  • Singapore
  • Germany (Frankfurt)
  • US (Virginia)
  • Hong Kong (China)

Parâmetro

Valor

RPM (Requisições por minuto)

30000

TPM (Tokens por minuto)

5.000.000

Versões snapshot

qwen3-max-preview

Versão preview do modelo Max da série Qwen 3 que integra eficazmente os modos de raciocínio e não raciocínio. No modo de raciocínio, há melhoria significativa em capacidades como programação de agentes inteligentes, raciocínio de senso comum e raciocínio em matemática, ciências e domínios gerais.

Provedor de service de inferência

O Alibaba Cloud Model Studio fornece o service de inferência para qwen3-max-preview.

Capacidades do modelo

  • China (Beijing)
  • Singapore
  • Germany (Frankfurt)
  • US (Virginia)

Capacidade

Suporte

Capacidade

Suporte

Modalidade de entrada

Text

Modalidade de saída

Text

Experiência do modelo

Supported

Function Calling

Unsupported

Saídas estruturadas

Unsupported

Busca na web

Unsupported

Conclusão de prefixo

Unsupported

Cache de contexto

Supported

Inferência em lote

Unsupported

Fine-tuning

Unsupported

Limites de contexto

Parâmetro

Valor

Parâmetro

Valor

Comprimento máximo de entrada

258048

Comprimento máximo de saída

65536

Janela de contexto

262144

Comprimento máximo de entrada (Modo de raciocínio)

258048

Comprimento máximo de saída (Modo de raciocínio)

32768

Comprimento máximo da cadeia de pensamento

81920

Preços

Esta página exibe apenas os preços originais para chamadas de API do modelo, sem incluir promoções por tempo limitado. Acesse o Model Studio Console para consultar ofertas promocionais.
  • China (Beijing)
  • Singapore
  • Germany (Frankfurt)
  • US (Virginia)

Item de faturamento

Preço (USD)

Unidade

Entrada

0,861

Por 1M tokens

Saída

3,441

Por 1M tokens

Entrada (Cache implícito)

0,173

Por 1M tokens

Item de faturamento

Preço (USD)

Unidade

Entrada

1,434

Por 1M tokens

Saída

5,735

Por 1M tokens

Entrada (Cache implícito)

0,287

Por 1M tokens

Item de faturamento

Preço (USD)

Unidade

Entrada

2,151

Por 1M tokens

Saída

8,602

Por 1M tokens

Entrada (Cache implícito)

0,431

Por 1M tokens

Limites de taxa

  • China (Beijing)
  • Singapore
  • Germany (Frankfurt)
  • US (Virginia)

Parâmetro

Valor

RPM (Requisições por minuto)

600

TPM (Tokens por minuto)

1.000.000

qwen3-max-2026-01-23

Em comparação com o snapshot de 23 de setembro de 2025, o modelo Max da série Qwen-3 nesta versão integra eficazmente os modos de raciocínio e não raciocínio, o que resulta em melhoria abrangente e substancial no desempenho geral. No modo de raciocínio, o modelo suporta simultaneamente busca na web, extração de informações da web e ferramenta de interpretador de código. Esses recursos permitem resolver problemas mais complexos e desafiadores com maior precisão ao usar ferramentas externas durante o raciocínio lento e deliberativo. Esta versão baseia-se em um snapshot de 23 de janeiro de 2026.

Provedor de service de inferência

O Alibaba Cloud Model Studio fornece o service de inferência para qwen3-max-2026-01-23.

Capacidades do modelo

  • China (Beijing)
  • Singapore
  • Germany (Frankfurt)
  • Hong Kong (China)

Capacidade

Suporte

Capacidade

Suporte

Modalidade de entrada

Text

Modalidade de saída

Text

Experiência do modelo

Supported

Function Calling

Supported

Saídas estruturadas

Supported

Busca na web

Supported

Conclusão de prefixo

Supported

Cache de contexto

Unsupported

Inferência em lote

Unsupported

Fine-tuning

Unsupported

Limites de contexto

Parâmetro

Valor

Parâmetro

Valor

Comprimento máximo de entrada

258048

Comprimento máximo de saída

65536

Janela de contexto

262144

Comprimento máximo de entrada (Modo de raciocínio)

258048

Comprimento máximo de saída (Modo de raciocínio)

32768

Comprimento máximo da cadeia de pensamento

81920

Preços

Esta página exibe apenas os preços originais para chamadas de API do modelo, sem incluir promoções por tempo limitado. Acesse o Model Studio Console para consultar ofertas promocionais.
  • China (Beijing)
  • Singapore
  • Germany (Frankfurt)
  • Hong Kong (China)

Item de faturamento

Preço (USD)

Unidade

Entrada

0,359

Por 1M tokens

Saída

1,434

Por 1M tokens

Item de faturamento

Preço (USD)

Unidade

Entrada

0,574

Por 1M tokens

Saída

2,294

Por 1M tokens

Item de faturamento

Preço (USD)

Unidade

Entrada

1,004

Por 1M tokens

Saída

4,014

Por 1M tokens

Limites de taxa

  • China (Beijing)
  • Singapore
  • Germany (Frankfurt)
  • Hong Kong (China)

Parâmetro

Valor

RPM (Requisições por minuto)

600

TPM (Tokens por minuto)

1.000.000

qwen3-max-2025-09-23

O modelo Max da série Qwen 3 recebeu atualizações especializadas em programação de agentes e invocação de ferramentas em comparação com a versão preview. O modelo lançado oficialmente alcançou desempenho state-of-the-art (SOTA) em sua categoria e atende melhor às demandas de agentes que operam em cenários mais complexos. Esta versão é um snapshot de 23 de setembro de 2025.

Provedor de service de inferência

O Alibaba Cloud Model Studio fornece o service de inferência para qwen3-max-2025-09-23.

Capacidades do modelo

  • China (Beijing)
  • Singapore
  • Germany (Frankfurt)
  • US (Virginia)

Capacidade

Suporte

Capacidade

Suporte

Modalidade de entrada

Text

Modalidade de saída

Text

Experiência do modelo

Supported

Function Calling

Supported

Saídas estruturadas

Supported

Busca na web

Supported

Conclusão de prefixo

Supported

Cache de contexto

Unsupported

Inferência em lote

Unsupported

Fine-tuning

Unsupported

Limites de contexto

Parâmetro

Valor

Parâmetro

Valor

Comprimento máximo de entrada

258048

Comprimento máximo de saída

32768

Janela de contexto

262144

Preços

Esta página exibe apenas os preços originais para chamadas de API do modelo, sem incluir promoções por tempo limitado. Acesse o Model Studio Console para consultar ofertas promocionais.
  • China (Beijing)
  • Singapore
  • Germany (Frankfurt)
  • US (Virginia)

Item de faturamento

Preço (USD)

Unidade

Entrada

0,86

Por 1M tokens

Saída

3,44

Por 1M tokens

Item de faturamento

Preço (USD)

Unidade

Entrada

1,434

Por 1M tokens

Saída

5,734

Por 1M tokens

Item de faturamento

Preço (USD)

Unidade

Entrada

2,15

Por 1M tokens

Saída

8,601

Por 1M tokens

Limites de taxa

  • China (Beijing)
  • Singapore
  • Germany (Frankfurt)
  • US (Virginia)

Parâmetro

Valor

RPM (Requisições por minuto)

60

TPM (Tokens por minuto)

100.000

Plano de Tokens
Playground de Modelos
  • Music generation
Inferência do Modelo
Avaliação
Compressão de Modelos
Estatísticas e Monitoramento