Skip to main content
Geração de Texto

qwen-flash-us

O modelo Qwen3 Flash combina modos de raciocínio e não raciocínio com alternância dinâmica durante a conversa. Ele se destaca em tarefas complexas de lógica e apresenta melhorias significativas no seguimento de instruções e na compreensão de texto. Com suporte a um contexto de 1M, seu faturamento é escalonado conforme o uso do contexto. Esta versão do modelo é funcionalmente equivalente ao snapshot qwen-flash-2025-07-28-us.

Provedor de service de inferência

O Alibaba Cloud Model Studio fornece o service de inferência para qwen-flash-us.

Capacidades do modelo

Capacidade

Suporte

Capacidade

Suporte

Modalidade de entrada

Text

Modalidade de saída

Text

Experiência do modelo

Supported

Function Calling

Unsupported

Saídas estruturadas

Supported

Pesquisa na web

Unsupported

Conclusão de prefixo

Supported

Cache de contexto

Supported

Inferência em lote

Unsupported

Fine-tuning

Unsupported

Limites de contexto

Parâmetro

Valor

Parâmetro

Valor

Comprimento máximo de entrada

995.904

Comprimento máximo de saída

32.768

Janela de contexto

1.000.000

Preços

Esta página exibe apenas os preços originais para chamadas de API do modelo, sem incluir promoções por tempo limitado. Acesse o Model Studio Console para conferir ofertas promocionais.
  • US (Virginia)
Escopo: US

Item de faturamento

Preço (USD)

Unidade

Entrada

0,05

Por 1M tokens

Saída

0,4

Por 1M tokens

Entrada (cache implícito)

0,01

Por 1M tokens

Item de faturamento

Preço (USD)

Unidade

Entrada

0,25

Por 1M tokens

Saída

2

Por 1M tokens

Entrada (cache implícito)

0,05

Por 1M tokens

Limites de taxa

  • US (Virginia)
Escopo: US

Parâmetro

Valor

RPM (solicitações por minuto)

30.000

TPM (tokens por minuto)

10.000.000

Versões de snapshot

qwen-flash-2025-07-28-us

O modelo Qwen3 Flash (snapshot 2025-07-28) integra modos de raciocínio e não raciocínio, permitindo alternância dinâmica durante a conversa. Seu desempenho é superior em raciocínio complexo, com avanços notáveis no seguimento de instruções e na compreensão textual. O modelo aceita até 1M de contexto e adota um modelo de faturamento escalonado baseado no uso.

Provedor de service de inferência

O Alibaba Cloud Model Studio fornece o service de inferência para qwen-flash-2025-07-28-us.

Capacidades do modelo

Capacidade

Suporte

Capacidade

Suporte

Modalidade de entrada

Text

Modalidade de saída

Text

Experiência do modelo

Supported

Function Calling

Unsupported

Saídas estruturadas

Supported

Pesquisa na web

Unsupported

Conclusão de prefixo

Supported

Cache de contexto

Unsupported

Inferência em lote

Unsupported

Fine-tuning

Unsupported

Limites de contexto

Parâmetro

Valor

Parâmetro

Valor

Comprimento máximo de entrada

995.904

Comprimento máximo de saída

32.768

Janela de contexto

1.000.000

Preços

Esta página exibe apenas os preços originais para chamadas de API do modelo, sem incluir promoções por tempo limitado. Acesse o Model Studio Console para conferir ofertas promocionais.
  • US (Virginia)
Escopo: US

Item de faturamento

Preço (USD)

Unidade

Entrada

0,05

Por 1M tokens

Saída

0,4

Por 1M tokens

Item de faturamento

Preço (USD)

Unidade

Entrada

0,25

Por 1M tokens

Saída

2

Por 1M tokens

Limites de taxa

  • US (Virginia)
Escopo: US

Parâmetro

Valor

RPM (solicitações por minuto)

30.000

TPM (tokens por minuto)

10.000.000

Plano de Tokens
Playground de Modelos
  • Music generation
Inferência do Modelo
Avaliação
Compressão de Modelos
Estatísticas e Monitoramento