Skip to main content
Geração de Texto

qwen-flash

O modelo Qwen3 Flash combina modos de raciocínio e não raciocínio com alternância dinâmica durante a conversa. Ele se destaca em raciocínios complexos e apresenta melhorias significativas no seguimento de instruções e na compreensão de texto. Com suporte a um contexto de 1 milhão de tokens, sua cobrança segue um modelo escalonado conforme o uso do contexto. Esta versão do modelo é funcionalmente equivalente ao snapshot qwen-flash-2025-07-28.

Provedor de service de inferência

O Alibaba Cloud Model Studio fornece o service de inferência para qwen-flash.

Capacidades do modelo

  • China (Beijing)
  • Singapore
  • Germany (Frankfurt)
  • US (Virginia)

Capacidade

Suporte

Capacidade

Suporte

Modalidade de entrada

Text

Modalidade de saída

Text

Experiência do modelo

Supported

Function Calling

Supported

Saídas estruturadas

Supported

Pesquisa na web

Supported

Conclusão de prefixo

Supported

Cache de contexto

Supported

Inferência em lote

Supported

Fine-tuning

Unsupported

Limites de contexto

Parâmetro

Valor

Parâmetro

Valor

Comprimento máximo de entrada

997952

Comprimento máximo de saída

32768

Janela de contexto

1000000

Preços

Esta página exibe apenas os preços originais para chamadas de API do modelo, sem incluir promoções por tempo limitado. Acesse o Model Studio Console para consultar ofertas promocionais.
  • China (Beijing)
  • Singapore
  • Germany (Frankfurt)
  • US (Virginia)

Item de cobrança

Preço (USD)

Unidade

Entrada

0,022

Por 1M tokens

Saída

0,216

Por 1M tokens

Entrada (cache implícito)

0,005

Por 1M tokens

Entrada (arquivo em lote)

0,011

Por 1M tokens

Saída (arquivo em lote)

0,108

Por 1M tokens

Criação de cache explícito

0,028

Por 1M tokens

Leitura de cache explícito

0,002

Por 1M tokens

Entrada (chat em lote)

0,022

Por 1M tokens

Saída (chat em lote)

0,216

Por 1M tokens

Item de cobrança

Preço (USD)

Unidade

Entrada

0,087

Por 1M tokens

Saída

0,861

Por 1M tokens

Entrada (cache implícito)

0,018

Por 1M tokens

Entrada (arquivo em lote)

0,043

Por 1M tokens

Saída (arquivo em lote)

0,43

Por 1M tokens

Criação de cache explícito

0,109

Por 1M tokens

Leitura de cache explícito

0,009

Por 1M tokens

Entrada (chat em lote)

0,087

Por 1M tokens

Saída (chat em lote)

0,861

Por 1M tokens

Item de cobrança

Preço (USD)

Unidade

Entrada

0,173

Por 1M tokens

Saída

1,721

Por 1M tokens

Entrada (cache implícito)

0,035

Por 1M tokens

Entrada (arquivo em lote)

0,086

Por 1M tokens

Saída (arquivo em lote)

0,86

Por 1M tokens

Criação de cache explícito

0,216

Por 1M tokens

Leitura de cache explícito

0,017

Por 1M tokens

Entrada (chat em lote)

0,173

Por 1M tokens

Saída (chat em lote)

1,721

Por 1M tokens

Limites de taxa

  • China (Beijing)
  • Singapore
  • Germany (Frankfurt)
  • US (Virginia)

Parâmetro

Valor

RPM (solicitações por minuto)

30000

TPM (tokens por minuto)

10.000.000

Versões de snapshot

qwen-flash-2025-07-28

O modelo Qwen3 Flash (snapshot 2025-07-28) combina modos de raciocínio e não raciocínio com alternância dinâmica durante a conversa. Ele se destaca em raciocínios complexos e apresenta melhorias significativas no seguimento de instruções e na compreensão de texto. Com suporte a um contexto de 1 milhão de tokens, sua cobrança segue um modelo escalonado conforme o uso do contexto.

Provedor de service de inferência

O Alibaba Cloud Model Studio fornece o service de inferência para qwen-flash-2025-07-28.

Capacidades do modelo

  • China (Beijing)
  • Singapore
  • Germany (Frankfurt)
  • US (Virginia)

Capacidade

Suporte

Capacidade

Suporte

Modalidade de entrada

Text

Modalidade de saída

Text

Experiência do modelo

Supported

Function Calling

Supported

Saídas estruturadas

Supported

Pesquisa na web

Supported

Conclusão de prefixo

Supported

Cache de contexto

Unsupported

Inferência em lote

Unsupported

Fine-tuning

Unsupported

Limites de contexto

Parâmetro

Valor

Parâmetro

Valor

Comprimento máximo de entrada

997952

Comprimento máximo de saída

32768

Janela de contexto

1000000

Preços

Esta página exibe apenas os preços originais para chamadas de API do modelo, sem incluir promoções por tempo limitado. Acesse o Model Studio Console para consultar ofertas promocionais.
  • China (Beijing)
  • Singapore
  • Germany (Frankfurt)
  • US (Virginia)

Item de cobrança

Preço (USD)

Unidade

Entrada

0,022

Por 1M tokens

Saída

0,216

Por 1M tokens

Item de cobrança

Preço (USD)

Unidade

Entrada

0,087

Por 1M tokens

Saída

0,861

Por 1M tokens

Item de cobrança

Preço (USD)

Unidade

Entrada

0,173

Por 1M tokens

Saída

1,721

Por 1M tokens

Limites de taxa

  • China (Beijing)
  • Singapore
  • Germany (Frankfurt)
  • US (Virginia)

Parâmetro

Valor

RPM (solicitações por minuto)

60

TPM (tokens por minuto)

1.000.000

Plano de Tokens
Playground de Modelos
  • Music generation
Inferência do Modelo
Avaliação
Compressão de Modelos
Estatísticas e Monitoramento