Skip to main content
Geração de Texto

qwen3.5-plus

Os modelos Plus da série nativa de visão e linguagem Qwen3.5 utilizam uma arquitetura híbrida que combina mecanismos de atenção linear com modelos esparsos de mistura de especialistas, garantindo maior eficiência na inferência. Em diversas avaliações de tarefas, a série 3.5 apresenta desempenho equivalente aos principais modelos de última geração. Em comparação com a série 3, esses modelos demonstram um avanço significativo tanto em capacidades puramente textuais quanto multimodais. Esta versão do modelo é funcionalmente equivalente ao snapshot qwen3.5-plus-2026-02-15.

Provedor de service de inferência

O Alibaba Cloud Model Studio fornece o service de inferência para qwen3.5-plus.

Capacidades do modelo

  • China (Beijing)
  • Singapore
  • Germany (Frankfurt)
  • US (Virginia)

Capacidade

Suporte

Capacidade

Suporte

Modalidade de entrada

Text Image Video

Modalidade de saída

Text

Experiência do modelo

Supported

Function Calling

Supported

Saídas estruturadas

Supported

Busca na web

Supported

Conclusão de prefixo

Supported

Cache de contexto

Supported

Inferência em lote

Supported

Fine-tuning

Unsupported

Limites de contexto

Parâmetro

Valor

Parâmetro

Valor

Comprimento máximo de entrada

991808

Comprimento máximo de saída

65536

Janela de contexto

1000000

Comprimento máximo de entrada (Modo de raciocínio)

983616

Comprimento máximo de saída (Modo de raciocínio)

65536

Comprimento máximo da cadeia de pensamento

81920

Preços

Esta página exibe apenas os preços originais para chamadas de API do modelo, sem incluir promoções por tempo limitado. Acesse o Model Studio Console para consultar ofertas promocionais.
  • China (Beijing)
  • Singapore
  • Germany (Frankfurt)
  • US (Virginia)

Item de faturamento

Preço (USD)

Unidade

Entrada

0,115

Por 1M tokens

Saída

0,688

Por 1M tokens

Entrada (arquivo em lote)

0,057

Por 1M tokens

Saída (arquivo em lote)

0,344

Por 1M tokens

Criação explícita de cache

0,143

Por 1M tokens

Leitura explícita de cache

0,012

Por 1M tokens

Entrada (chat em lote)

0,115

Por 1M tokens

Saída (chat em lote)

0,688

Por 1M tokens

Item de faturamento

Preço (USD)

Unidade

Entrada

0,287

Por 1M tokens

Saída

1,72

Por 1M tokens

Entrada (arquivo em lote)

0,143

Por 1M tokens

Saída (arquivo em lote)

0,86

Por 1M tokens

Criação explícita de cache

0,358

Por 1M tokens

Leitura explícita de cache

0,029

Por 1M tokens

Entrada (chat em lote)

0,287

Por 1M tokens

Saída (chat em lote)

1,72

Por 1M tokens

Item de faturamento

Preço (USD)

Unidade

Entrada

0,573

Por 1M tokens

Saída

3,44

Por 1M tokens

Entrada (arquivo em lote)

0,287

Por 1M tokens

Saída (arquivo em lote)

1,72

Por 1M tokens

Criação explícita de cache

0,717

Por 1M tokens

Leitura explícita de cache

0,057

Por 1M tokens

Entrada (chat em lote)

0,573

Por 1M tokens

Saída (chat em lote)

3,44

Por 1M tokens

Limites de taxa

  • China (Beijing)
  • Singapore
  • Germany (Frankfurt)
  • US (Virginia)

Parâmetro

Valor

RPM (solicitações por minuto)

30000

TPM (tokens por minuto)

5.000.000

Versões de snapshot

qwen3.5-plus-2026-04-20

O modelo Plus da série nativa de visão e linguagem Qwen3.5 teve uma melhoria substancial nas capacidades de codificação agêntica em comparação com o snapshot de 15 de fevereiro. A velocidade de inferência também melhorou significativamente, enquanto a retenção de conhecimento, a capacidade de raciocínio e o processamento de contexto longo permanecem em alto nível, tornando-o adequado para tarefas complexas baseadas em agentes. É ideal para aplicações como agentes de codificação, fluxos de trabalho de produção e cenários de alto throughput. Esta versão baseia-se em um snapshot capturado em 20 de abril de 2026.

Provedor de service de inferência

O Alibaba Cloud Model Studio fornece o service de inferência para qwen3.5-plus-2026-04-20.

Capacidades do modelo

Capacidade

Suporte

Capacidade

Suporte

Modalidade de entrada

Image Text Video

Modalidade de saída

Text

Experiência do modelo

Supported

Function Calling

Supported

Saídas estruturadas

Supported

Busca na web

Supported

Conclusão de prefixo

Supported

Cache de contexto

Supported

Inferência em lote

Unsupported

Fine-tuning

Unsupported

Limites de contexto

Parâmetro

Valor

Parâmetro

Valor

Comprimento máximo de entrada

991808

Comprimento máximo de saída

65536

Janela de contexto

1000000

Comprimento máximo de entrada (Modo de raciocínio)

983616

Comprimento máximo de saída (Modo de raciocínio)

65536

Preços

Esta página exibe apenas os preços originais para chamadas de API do modelo, sem incluir promoções por tempo limitado. Acesse o Model Studio Console para consultar ofertas promocionais.
  • China (Beijing)
  • Singapore

Item de faturamento

Preço (USD)

Unidade

Entrada

0,115

Por 1M tokens

Saída

0,688

Por 1M tokens

Criação explícita de cache

0,14375

Por 1M tokens

Leitura explícita de cache

0,0115

Por 1M tokens

Item de faturamento

Preço (USD)

Unidade

Entrada

0,287

Por 1M tokens

Saída

1,72

Por 1M tokens

Criação explícita de cache

0,35875

Por 1M tokens

Leitura explícita de cache

0,0287

Por 1M tokens

Item de faturamento

Preço (USD)

Unidade

Entrada

0,573

Por 1M tokens

Saída

3,44

Por 1M tokens

Criação explícita de cache

0,71625

Por 1M tokens

Leitura explícita de cache

0,0573

Por 1M tokens

Limites de taxa

  • China (Beijing)
  • Singapore

Parâmetro

Valor

RPM (solicitações por minuto)

600

TPM (tokens por minuto)

1.000.000

qwen3.5-plus-2026-02-15

Os modelos Plus da série nativa de visão e linguagem Qwen3.5 utilizam uma arquitetura híbrida que combina mecanismos de atenção linear com modelos esparsos de mistura de especialistas, garantindo maior eficiência na inferência. Em diversas avaliações de tarefas, a série 3.5 apresenta desempenho equivalente aos principais modelos de última geração. Em comparação com a série 3, esses modelos demonstram um avanço significativo tanto em capacidades puramente textuais quanto multimodais. Esta versão corresponde a um snapshot de 15 de fevereiro de 2026.

Provedor de service de inferência

O Alibaba Cloud Model Studio fornece o service de inferência para qwen3.5-plus-2026-02-15.

Capacidades do modelo

  • China (Beijing)
  • Singapore
  • Germany (Frankfurt)
  • US (Virginia)

Capacidade

Suporte

Capacidade

Suporte

Modalidade de entrada

Text Image Video

Modalidade de saída

Text

Experiência do modelo

Supported

Function Calling

Supported

Saídas estruturadas

Supported

Busca na web

Supported

Conclusão de prefixo

Supported

Cache de contexto

Unsupported

Inferência em lote

Unsupported

Fine-tuning

Unsupported

Limites de contexto

Parâmetro

Valor

Parâmetro

Valor

Comprimento máximo de entrada

991808

Comprimento máximo de saída

65536

Janela de contexto

1000000

Comprimento máximo de entrada (Modo de raciocínio)

983616

Comprimento máximo de saída (Modo de raciocínio)

65536

Comprimento máximo da cadeia de pensamento

81920

Preços

Esta página exibe apenas os preços originais para chamadas de API do modelo, sem incluir promoções por tempo limitado. Acesse o Model Studio Console para consultar ofertas promocionais.
  • China (Beijing)
  • Singapore
  • Germany (Frankfurt)
  • US (Virginia)

Item de faturamento

Preço (USD)

Unidade

Entrada

0,115

Por 1M tokens

Saída

0,688

Por 1M tokens

Item de faturamento

Preço (USD)

Unidade

Entrada

0,287

Por 1M tokens

Saída

1,72

Por 1M tokens

Item de faturamento

Preço (USD)

Unidade

Entrada

0,573

Por 1M tokens

Saída

3,44

Por 1M tokens

Limites de taxa

  • China (Beijing)
  • Singapore
  • Germany (Frankfurt)
  • US (Virginia)

Parâmetro

Valor

RPM (solicitações por minuto)

600

TPM (tokens por minuto)

1.000.000

Plano de Tokens
Playground de Modelos
  • Music generation
Inferência do Modelo
Avaliação
Compressão de Modelos
Estatísticas e Monitoramento
qwen3.5-plus - Alibaba Cloud Model Studio