Skip to main content
Geração de Texto

qwen3.5-flash

Os modelos Flash nativos de visão e linguagem do Qwen3.5 utilizam uma arquitetura híbrida que combina um mecanismo de atenção linear com um modelo de mistura esparsa de especialistas, garantindo maior eficiência na inferência. Em comparação à série 3, esses modelos oferecem um salto significativo de desempenho tanto em tarefas puramente textuais quanto multimodais, proporcionando tempos de resposta rápidos e equilibrando velocidade de inferência com performance geral. Esta versão do modelo é funcionalmente equivalente ao modelo snapshot qwen3.5-flash-2026-02-23.

Provedor de service de inferência

O Alibaba Cloud Model Studio é o provedor de service de inferência para qwen3.5-flash.

Capacidades do modelo

  • China (Beijing)
  • Singapore
  • Germany (Frankfurt)
  • US (Virginia)
  • Hong Kong (China)

Capacidade

Suporte

Capacidade

Suporte

Modalidade de entrada

Text Image Video

Modalidade de saída

Text

Experiência do modelo

Supported

Function Calling

Supported

Saídas estruturadas

Supported

Busca na web

Supported

Conclusão de prefixo

Supported

Cache de contexto

Supported

Inferência em lote

Supported

Fine-tuning

Unsupported

Limites de contexto

Parâmetro

Valor

Parâmetro

Valor

Comprimento máximo de entrada

991.808

Comprimento máximo de saída

65.536

Janela de contexto

1.000.000

Comprimento máximo de entrada (Modo de raciocínio)

983.616

Comprimento máximo de saída (Modo de raciocínio)

65.536

Comprimento máximo da cadeia de pensamento

81.920

Preços

Esta página exibe apenas os preços originais para chamadas de API do modelo, sem incluir promoções por tempo limitado. Acesse o Model Studio Console para consultar ofertas promocionais.
  • China (Beijing)
  • Singapore
  • Germany (Frankfurt)
  • US (Virginia)
  • Hong Kong (China)

Item de faturamento

Preço (USD)

Unidade

Entrada

0,029

Por 1M tokens

Saída

0,287

Por 1M tokens

Entrada (Arquivo em lote)

0,014

Por 1M tokens

Saída (Arquivo em lote)

0,143

Por 1M tokens

Criação explícita de cache

0,036

Por 1M tokens

Leitura explícita de cache

0,003

Por 1M tokens

Entrada (Chat em lote)

0,029

Por 1M tokens

Saída (Chat em lote)

0,287

Por 1M tokens

Item de faturamento

Preço (USD)

Unidade

Entrada

0,115

Por 1M tokens

Saída

1,147

Por 1M tokens

Entrada (Arquivo em lote)

0,057

Por 1M tokens

Saída (Arquivo em lote)

0,573

Por 1M tokens

Criação explícita de cache

0,143

Por 1M tokens

Leitura explícita de cache

0,012

Por 1M tokens

Entrada (Chat em lote)

0,115

Por 1M tokens

Saída (Chat em lote)

1,147

Por 1M tokens

Item de faturamento

Preço (USD)

Unidade

Entrada

0,172

Por 1M tokens

Saída

1,72

Por 1M tokens

Entrada (Arquivo em lote)

0,086

Por 1M tokens

Saída (Arquivo em lote)

0,86

Por 1M tokens

Criação explícita de cache

0,215

Por 1M tokens

Leitura explícita de cache

0,017

Por 1M tokens

Entrada (Chat em lote)

0,172

Por 1M tokens

Saída (Chat em lote)

1,72

Por 1M tokens

Limites de taxa

  • China (Beijing)
  • Singapore
  • Germany (Frankfurt)
  • US (Virginia)
  • Hong Kong (China)

Parâmetro

Valor

RPM (Requisições por minuto)

30.000

TPM (Tokens por minuto)

10.000.000

Versões snapshot

qwen3.5-flash-2026-02-23

Os modelos Flash nativos de visão e linguagem do Qwen3.5 utilizam uma arquitetura híbrida que combina um mecanismo de atenção linear com um modelo de mistura esparsa de especialistas, garantindo maior eficiência na inferência. Em comparação à série 3, esses modelos oferecem um salto significativo de desempenho tanto em tarefas puramente textuais quanto multimodais, proporcionando tempos de resposta rápidos e equilibrando velocidade de inferência com performance geral. Esta versão é um snapshot de 23 de fevereiro de 2026.

Provedor de service de inferência

O Alibaba Cloud Model Studio é o provedor de service de inferência para qwen3.5-flash-2026-02-23.

Capacidades do modelo

  • China (Beijing)
  • Singapore
  • Germany (Frankfurt)
  • US (Virginia)
  • Hong Kong (China)

Capacidade

Suporte

Capacidade

Suporte

Modalidade de entrada

Text Image Video

Modalidade de saída

Text

Experiência do modelo

Supported

Function Calling

Supported

Saídas estruturadas

Supported

Busca na web

Supported

Conclusão de prefixo

Supported

Cache de contexto

Unsupported

Inferência em lote

Unsupported

Fine-tuning

Supported

Limites de contexto

Parâmetro

Valor

Parâmetro

Valor

Comprimento máximo de entrada

991.808

Comprimento máximo de saída

65.536

Janela de contexto

1.000.000

Comprimento máximo de entrada (Modo de raciocínio)

983.616

Comprimento máximo de saída (Modo de raciocínio)

65.536

Comprimento máximo da cadeia de pensamento

81.920

Preços

Esta página exibe apenas os preços originais para chamadas de API do modelo, sem incluir promoções por tempo limitado. Acesse o Model Studio Console para consultar ofertas promocionais.
  • China (Beijing)
  • Singapore
  • Germany (Frankfurt)
  • US (Virginia)
  • Hong Kong (China)

Item de faturamento

Preço (USD)

Unidade

Entrada

0,029

Por 1M tokens

Saída

0,287

Por 1M tokens

Item de faturamento

Preço (USD)

Unidade

Entrada

0,115

Por 1M tokens

Saída

1,147

Por 1M tokens

Item de faturamento

Preço (USD)

Unidade

Entrada

0,172

Por 1M tokens

Saída

1,72

Por 1M tokens

Limites de taxa

  • China (Beijing)
  • Singapore
  • Germany (Frankfurt)
  • US (Virginia)
  • Hong Kong (China)

Parâmetro

Valor

RPM (Requisições por minuto)

600

TPM (Tokens por minuto)

1.000.000

Plano de Tokens
Playground de Modelos
  • Music generation
Inferência do Modelo
Avaliação
Compressão de Modelos
Estatísticas e Monitoramento