O modelo Qwen3 Flash combina modos de raciocínio e não raciocínio com alternância dinâmica durante a conversa. Ele se destaca em tarefas complexas de lógica e apresenta melhorias significativas no seguimento de instruções e na compreensão de texto. Com suporte a um contexto de 1M, seu faturamento é escalonado conforme o uso do contexto. Esta versão do modelo é funcionalmente equivalente ao snapshot qwen-flash-2025-07-28-us.
Provedor de service de inferência
O Alibaba Cloud Model Studio fornece o service de inferência para qwen-flash-us.
Capacidades do modelo
Capacidade | Suporte | Capacidade | Suporte |
Modalidade de entrada | Text | Modalidade de saída | Text |
Experiência do modelo | Supported | Function Calling | Unsupported |
Saídas estruturadas | Supported | Pesquisa na web | Unsupported |
Conclusão de prefixo | Supported | Cache de contexto | Supported |
Inferência em lote | Unsupported | Fine-tuning | Unsupported |
Limites de contexto
Parâmetro | Valor | Parâmetro | Valor |
Comprimento máximo de entrada | 995.904 | Comprimento máximo de saída | 32.768 |
Janela de contexto | 1.000.000 |
Preços
Esta página exibe apenas os preços originais para chamadas de API do modelo, sem incluir promoções por tempo limitado. Acesse o Model Studio Console para conferir ofertas promocionais.
- US (Virginia)
Input<=256k
Input<=256k
Item de faturamento | Preço (USD) | Unidade |
Entrada | 0,05 | Por 1M tokens |
Saída | 0,4 | Por 1M tokens |
Entrada (cache implícito) | 0,01 | Por 1M tokens |
256k<Input<=1m
256k<Input<=1m
Item de faturamento | Preço (USD) | Unidade |
Entrada | 0,25 | Por 1M tokens |
Saída | 2 | Por 1M tokens |
Entrada (cache implícito) | 0,05 | Por 1M tokens |
Limites de taxa
- US (Virginia)
Parâmetro | Valor |
RPM (solicitações por minuto) | 30.000 |
TPM (tokens por minuto) | 10.000.000 |
Versões de snapshot
qwen-flash-2025-07-28-us
O modelo Qwen3 Flash (snapshot 2025-07-28) integra modos de raciocínio e não raciocínio, permitindo alternância dinâmica durante a conversa. Seu desempenho é superior em raciocínio complexo, com avanços notáveis no seguimento de instruções e na compreensão textual. O modelo aceita até 1M de contexto e adota um modelo de faturamento escalonado baseado no uso.
Provedor de service de inferência
O Alibaba Cloud Model Studio fornece o service de inferência para qwen-flash-2025-07-28-us.
Capacidades do modelo
Capacidade | Suporte | Capacidade | Suporte |
Modalidade de entrada | Text | Modalidade de saída | Text |
Experiência do modelo | Supported | Function Calling | Unsupported |
Saídas estruturadas | Supported | Pesquisa na web | Unsupported |
Conclusão de prefixo | Supported | Cache de contexto | Unsupported |
Inferência em lote | Unsupported | Fine-tuning | Unsupported |
Limites de contexto
Parâmetro | Valor | Parâmetro | Valor |
Comprimento máximo de entrada | 995.904 | Comprimento máximo de saída | 32.768 |
Janela de contexto | 1.000.000 |
Preços
Esta página exibe apenas os preços originais para chamadas de API do modelo, sem incluir promoções por tempo limitado. Acesse o Model Studio Console para conferir ofertas promocionais.
- US (Virginia)
Input<=256k
Input<=256k
Item de faturamento | Preço (USD) | Unidade |
Entrada | 0,05 | Por 1M tokens |
Saída | 0,4 | Por 1M tokens |
256k<Input<=1m
256k<Input<=1m
Item de faturamento | Preço (USD) | Unidade |
Entrada | 0,25 | Por 1M tokens |
Saída | 2 | Por 1M tokens |
Limites de taxa
- US (Virginia)
Parâmetro | Valor |
RPM (solicitações por minuto) | 30.000 |
TPM (tokens por minuto) | 10.000.000 |