A série Qwen3 de modelos de compreensão visual de pequena escala integra eficientemente os modos de raciocínio e não raciocínio, oferecendo desempenho superior ao modelo open-source Qwen3-VL-30B-A3B com respostas rápidas. O modelo apresenta uma atualização abrangente na compreensão de imagens e vídeos, com suporte a contextos extremamente longos (como vídeos extensos e documentos), percepção espacial e reconhecimento de objetos em diversos domínios. Com capacidades de localização visual 2D/3D, é ideal para tarefas complexas do mundo real. Esta versão do modelo é funcionalmente equivalente ao snapshot qwen3-vl-flash-2026-01-22-us.
Provedor de service de inferência
O Alibaba Cloud Model Studio fornece o service de inferência para qwen3-vl-flash-us.
Capacidades do modelo
Capacidade | Suporte | Capacidade | Suporte |
Modalidade de entrada | Text Image Video | Modalidade de saída | Text |
Experiência do modelo | Supported | Function Calling | Unsupported |
Saídas estruturadas | Supported | Pesquisa na web | Unsupported |
Conclusão de prefixo | Supported | Cache de contexto | Supported |
Inferência em lote | Unsupported | Fine-tuning | Unsupported |
Limites de contexto
Parâmetro | Valor | Parâmetro | Valor |
Comprimento máximo de entrada | 258.048 | Comprimento máximo de saída | 32.768 |
Janela de contexto | 262.144 | Comprimento máximo de entrada (Modo de raciocínio) | 258.048 |
Comprimento máximo de saída (Modo de raciocínio) | 32.768 | Comprimento máximo da cadeia de pensamento | 81.920 |
Preços
Esta página exibe apenas os preços originais para chamadas de API do modelo, sem incluir promoções por tempo limitado. Acesse o Model Studio Console para consultar ofertas promocionais.
- US (Virginia)
Input<=32k
Input<=32k
Item de faturamento | Preço (USD) | Unidade |
Entrada | 0,05 | Por 1M tokens |
Saída | 0,4 | Por 1M tokens |
Entrada (Cache implícito) | 0,01 | Por 1M tokens |
Criação de cache explícito | 0,0625 | Por 1M tokens |
Leitura de cache explícito | 0,005 | Por 1M tokens |
32k<Input<=128k
32k<Input<=128k
Item de faturamento | Preço (USD) | Unidade |
Entrada | 0,075 | Por 1M tokens |
Saída | 0,6 | Por 1M tokens |
Entrada (Cache implícito) | 0,015 | Por 1M tokens |
Criação de cache explícito | 0,09375 | Por 1M tokens |
Leitura de cache explícito | 0,0075 | Por 1M tokens |
128k<Input<=256k
128k<Input<=256k
Item de faturamento | Preço (USD) | Unidade |
Entrada | 0,12 | Por 1M tokens |
Saída | 0,96 | Por 1M tokens |
Entrada (Cache implícito) | 0,024 | Por 1M tokens |
Criação de cache explícito | 0,15 | Por 1M tokens |
Leitura de cache explícito | 0,012 | Por 1M tokens |
Limites de taxa
- US (Virginia)
Parâmetro | Valor |
RPM (Requisições por minuto) | 6.000 |
TPM (Tokens por minuto) | 1.000.000 |
Versões de snapshot
qwen3-vl-flash-2026-01-22-us
A série Qwen3 de modelos de compreensão visual de pequeno porte integra eficientemente os modos de raciocínio e não raciocínio. Em comparação com o snapshot de 15 de outubro de 2025, o desempenho geral do modelo melhorou significativamente: ele oferece capacidades aprimoradas de reconhecimento visual geral e raciocínio, além de apresentar melhorias expressivas na precisão de reconhecimento em diversos cenários de negócios, como segurança, inspeções em lojas, monitoramento de equipamentos e resolução de problemas por foto. Esta versão corresponde ao snapshot de 22 de janeiro de 2026.
Provedor de service de inferência
O Alibaba Cloud Model Studio fornece o service de inferência para qwen3-vl-flash-2026-01-22-us.
Capacidades do modelo
Capacidade | Suporte | Capacidade | Suporte |
Modalidade de entrada | Text Image Video | Modalidade de saída | Text |
Experiência do modelo | Supported | Function Calling | Unsupported |
Saídas estruturadas | Unsupported | Pesquisa na web | Unsupported |
Conclusão de prefixo | Unsupported | Cache de contexto | Unsupported |
Inferência em lote | Unsupported | Fine-tuning | Unsupported |
Limites de contexto
Parâmetro | Valor | Parâmetro | Valor |
Comprimento máximo de entrada | 260.096 | Comprimento máximo de saída | 32.768 |
Janela de contexto | 262.144 | Comprimento máximo de entrada (Modo de raciocínio) | 258.048 |
Comprimento máximo de saída (Modo de raciocínio) | 32.768 |
Preços
Esta página exibe apenas os preços originais para chamadas de API do modelo, sem incluir promoções por tempo limitado. Acesse o Model Studio Console para consultar ofertas promocionais.
- US (Virginia)
Input<=32k
Input<=32k
Item de faturamento | Preço (USD) | Unidade |
Entrada | 0,05 | Por 1M tokens |
Saída | 0,4 | Por 1M tokens |
32k<Input<=128k
32k<Input<=128k
Item de faturamento | Preço (USD) | Unidade |
Entrada | 0,075 | Por 1M tokens |
Saída | 0,6 | Por 1M tokens |
128k<Input<=256k
128k<Input<=256k
Item de faturamento | Preço (USD) | Unidade |
Entrada | 0,12 | Por 1M tokens |
Saída | 0,96 | Por 1M tokens |
Limites de taxa
- US (Virginia)
Parâmetro | Valor |
RPM (Requisições por minuto) | 60 |
TPM (Tokens por minuto) | 1.000.000 |
qwen3-vl-flash-2025-10-15-us
A série Qwen3 de modelos de compreensão visual de pequena escala integra eficientemente os modos de raciocínio e não raciocínio, oferecendo desempenho superior ao modelo open-source Qwen3-VL-30B-A3B com respostas rápidas. O modelo apresenta uma atualização abrangente na compreensão de imagens e vídeos, com suporte a contextos extremamente longos (como vídeos extensos e documentos), percepção espacial e reconhecimento de objetos em diversos domínios. Com capacidades de localização visual 2D/3D, é ideal para tarefas complexas do mundo real. Esta versão corresponde ao snapshot de 15 de outubro de 2025.
Provedor de service de inferência
O Alibaba Cloud Model Studio fornece o service de inferência para qwen3-vl-flash-2025-10-15-us.
Capacidades do modelo
Capacidade | Suporte | Capacidade | Suporte |
Modalidade de entrada | Text Image Video | Modalidade de saída | Text |
Experiência do modelo | Supported | Function Calling | Unsupported |
Saídas estruturadas | Supported | Pesquisa na web | Unsupported |
Conclusão de prefixo | Supported | Cache de contexto | Unsupported |
Inferência em lote | Unsupported | Fine-tuning | Unsupported |
Limites de contexto
Parâmetro | Valor | Parâmetro | Valor |
Comprimento máximo de entrada | 258.048 | Comprimento máximo de saída | 32.768 |
Janela de contexto | 262.144 | Comprimento máximo de entrada (Modo de raciocínio) | 258.048 |
Comprimento máximo de saída (Modo de raciocínio) | 32.768 | Comprimento máximo da cadeia de pensamento | 81.920 |
Preços
Esta página exibe apenas os preços originais para chamadas de API do modelo, sem incluir promoções por tempo limitado. Acesse o Model Studio Console para consultar ofertas promocionais.
- US (Virginia)
Input<=32k
Input<=32k
Item de faturamento | Preço (USD) | Unidade |
Entrada | 0,05 | Por 1M tokens |
Saída | 0,4 | Por 1M tokens |
32k<Input<=128k
32k<Input<=128k
Item de faturamento | Preço (USD) | Unidade |
Entrada | 0,075 | Por 1M tokens |
Saída | 0,6 | Por 1M tokens |
128k<Input<=256k
128k<Input<=256k
Item de faturamento | Preço (USD) | Unidade |
Entrada | 0,12 | Por 1M tokens |
Saída | 0,96 | Por 1M tokens |
Limites de taxa
- US (Virginia)
Parâmetro | Valor |
RPM (Requisições por minuto) | 6.000 |
TPM (Tokens por minuto) | 1.000.000 |