Skip to main content
Visão

qwen3-vl-flash-us

A série Qwen3 de modelos de compreensão visual de pequena escala integra eficientemente os modos de raciocínio e não raciocínio, oferecendo desempenho superior ao modelo open-source Qwen3-VL-30B-A3B com respostas rápidas. O modelo apresenta uma atualização abrangente na compreensão de imagens e vídeos, com suporte a contextos extremamente longos (como vídeos extensos e documentos), percepção espacial e reconhecimento de objetos em diversos domínios. Com capacidades de localização visual 2D/3D, é ideal para tarefas complexas do mundo real. Esta versão do modelo é funcionalmente equivalente ao snapshot qwen3-vl-flash-2026-01-22-us.

Provedor de service de inferência

O Alibaba Cloud Model Studio fornece o service de inferência para qwen3-vl-flash-us.

Capacidades do modelo

Capacidade

Suporte

Capacidade

Suporte

Modalidade de entrada

Text Image Video

Modalidade de saída

Text

Experiência do modelo

Supported

Function Calling

Unsupported

Saídas estruturadas

Supported

Pesquisa na web

Unsupported

Conclusão de prefixo

Supported

Cache de contexto

Supported

Inferência em lote

Unsupported

Fine-tuning

Unsupported

Limites de contexto

Parâmetro

Valor

Parâmetro

Valor

Comprimento máximo de entrada

258.048

Comprimento máximo de saída

32.768

Janela de contexto

262.144

Comprimento máximo de entrada (Modo de raciocínio)

258.048

Comprimento máximo de saída (Modo de raciocínio)

32.768

Comprimento máximo da cadeia de pensamento

81.920

Preços

Esta página exibe apenas os preços originais para chamadas de API do modelo, sem incluir promoções por tempo limitado. Acesse o Model Studio Console para consultar ofertas promocionais.
  • US (Virginia)
Escopo: US

Item de faturamento

Preço (USD)

Unidade

Entrada

0,05

Por 1M tokens

Saída

0,4

Por 1M tokens

Entrada (Cache implícito)

0,01

Por 1M tokens

Criação de cache explícito

0,0625

Por 1M tokens

Leitura de cache explícito

0,005

Por 1M tokens

Item de faturamento

Preço (USD)

Unidade

Entrada

0,075

Por 1M tokens

Saída

0,6

Por 1M tokens

Entrada (Cache implícito)

0,015

Por 1M tokens

Criação de cache explícito

0,09375

Por 1M tokens

Leitura de cache explícito

0,0075

Por 1M tokens

Item de faturamento

Preço (USD)

Unidade

Entrada

0,12

Por 1M tokens

Saída

0,96

Por 1M tokens

Entrada (Cache implícito)

0,024

Por 1M tokens

Criação de cache explícito

0,15

Por 1M tokens

Leitura de cache explícito

0,012

Por 1M tokens

Limites de taxa

  • US (Virginia)
Escopo: US

Parâmetro

Valor

RPM (Requisições por minuto)

6.000

TPM (Tokens por minuto)

1.000.000

Versões de snapshot

qwen3-vl-flash-2026-01-22-us

A série Qwen3 de modelos de compreensão visual de pequeno porte integra eficientemente os modos de raciocínio e não raciocínio. Em comparação com o snapshot de 15 de outubro de 2025, o desempenho geral do modelo melhorou significativamente: ele oferece capacidades aprimoradas de reconhecimento visual geral e raciocínio, além de apresentar melhorias expressivas na precisão de reconhecimento em diversos cenários de negócios, como segurança, inspeções em lojas, monitoramento de equipamentos e resolução de problemas por foto. Esta versão corresponde ao snapshot de 22 de janeiro de 2026.

Provedor de service de inferência

O Alibaba Cloud Model Studio fornece o service de inferência para qwen3-vl-flash-2026-01-22-us.

Capacidades do modelo

Capacidade

Suporte

Capacidade

Suporte

Modalidade de entrada

Text Image Video

Modalidade de saída

Text

Experiência do modelo

Supported

Function Calling

Unsupported

Saídas estruturadas

Unsupported

Pesquisa na web

Unsupported

Conclusão de prefixo

Unsupported

Cache de contexto

Unsupported

Inferência em lote

Unsupported

Fine-tuning

Unsupported

Limites de contexto

Parâmetro

Valor

Parâmetro

Valor

Comprimento máximo de entrada

260.096

Comprimento máximo de saída

32.768

Janela de contexto

262.144

Comprimento máximo de entrada (Modo de raciocínio)

258.048

Comprimento máximo de saída (Modo de raciocínio)

32.768

Preços

Esta página exibe apenas os preços originais para chamadas de API do modelo, sem incluir promoções por tempo limitado. Acesse o Model Studio Console para consultar ofertas promocionais.
  • US (Virginia)
Escopo: US

Item de faturamento

Preço (USD)

Unidade

Entrada

0,05

Por 1M tokens

Saída

0,4

Por 1M tokens

Item de faturamento

Preço (USD)

Unidade

Entrada

0,075

Por 1M tokens

Saída

0,6

Por 1M tokens

Item de faturamento

Preço (USD)

Unidade

Entrada

0,12

Por 1M tokens

Saída

0,96

Por 1M tokens

Limites de taxa

  • US (Virginia)
Escopo: US

Parâmetro

Valor

RPM (Requisições por minuto)

60

TPM (Tokens por minuto)

1.000.000

qwen3-vl-flash-2025-10-15-us

A série Qwen3 de modelos de compreensão visual de pequena escala integra eficientemente os modos de raciocínio e não raciocínio, oferecendo desempenho superior ao modelo open-source Qwen3-VL-30B-A3B com respostas rápidas. O modelo apresenta uma atualização abrangente na compreensão de imagens e vídeos, com suporte a contextos extremamente longos (como vídeos extensos e documentos), percepção espacial e reconhecimento de objetos em diversos domínios. Com capacidades de localização visual 2D/3D, é ideal para tarefas complexas do mundo real. Esta versão corresponde ao snapshot de 15 de outubro de 2025.

Provedor de service de inferência

O Alibaba Cloud Model Studio fornece o service de inferência para qwen3-vl-flash-2025-10-15-us.

Capacidades do modelo

Capacidade

Suporte

Capacidade

Suporte

Modalidade de entrada

Text Image Video

Modalidade de saída

Text

Experiência do modelo

Supported

Function Calling

Unsupported

Saídas estruturadas

Supported

Pesquisa na web

Unsupported

Conclusão de prefixo

Supported

Cache de contexto

Unsupported

Inferência em lote

Unsupported

Fine-tuning

Unsupported

Limites de contexto

Parâmetro

Valor

Parâmetro

Valor

Comprimento máximo de entrada

258.048

Comprimento máximo de saída

32.768

Janela de contexto

262.144

Comprimento máximo de entrada (Modo de raciocínio)

258.048

Comprimento máximo de saída (Modo de raciocínio)

32.768

Comprimento máximo da cadeia de pensamento

81.920

Preços

Esta página exibe apenas os preços originais para chamadas de API do modelo, sem incluir promoções por tempo limitado. Acesse o Model Studio Console para consultar ofertas promocionais.
  • US (Virginia)
Escopo: US

Item de faturamento

Preço (USD)

Unidade

Entrada

0,05

Por 1M tokens

Saída

0,4

Por 1M tokens

Item de faturamento

Preço (USD)

Unidade

Entrada

0,075

Por 1M tokens

Saída

0,6

Por 1M tokens

Item de faturamento

Preço (USD)

Unidade

Entrada

0,12

Por 1M tokens

Saída

0,96

Por 1M tokens

Limites de taxa

  • US (Virginia)
Escopo: US

Parâmetro

Valor

RPM (Requisições por minuto)

6.000

TPM (Tokens por minuto)

1.000.000

Plano de Tokens
Playground de Modelos
  • Music generation
Inferência do Modelo
Avaliação
Compressão de Modelos
Estatísticas e Monitoramento
qwen3-vl-flash-us - Alibaba Cloud Model Studio