Skip to main content
Visão

qwen3-vl-flash

A série Qwen3 de modelos de compreensão visual de pequena escala integra eficazmente os modos de raciocínio e não raciocínio. Oferece desempenho superior ao modelo open-source Qwen3-VL-30B-A3B, mantendo respostas rápidas. O modelo apresenta uma atualização abrangente na compreensão de imagens e vídeos, com suporte a contextos extremamente longos (como vídeos extensos e documentos), percepção espacial e reconhecimento de objetos em diversos domínios. Com capacidades de localização visual 2D/3D, é ideal para tarefas complexas do mundo real. Esta versão do modelo é funcionalmente equivalente ao snapshot qwen3-vl-flash-2026-01-22.

Provedor de service de inferência

O provedor de service de inferência para qwen3-vl-flash é o Alibaba Cloud Model Studio.

Capacidades do modelo

  • China (Beijing)
  • Singapore
  • Germany (Frankfurt)
  • US (Virginia)

Capacidade

Suporte

Capacidade

Suporte

Modalidade de entrada

Text Image Video

Modalidade de saída

Text

Experiência do modelo

Supported

Function Calling

Supported

Saídas estruturadas

Supported

Pesquisa na web

Unsupported

Conclusão de prefixo

Supported

Cache de contexto

Supported

Inferência em lote

Unsupported

Ajuste fino

Unsupported

Limites de contexto

Parâmetro

Valor

Parâmetro

Valor

Comprimento máximo de entrada

260096

Comprimento máximo de saída

32768

Janela de contexto

262144

Comprimento máximo de entrada (Modo de raciocínio)

258048

Comprimento máximo de saída (Modo de raciocínio)

32768

Comprimento máximo da cadeia de pensamento

81920

Preços

Esta página exibe apenas os preços originais para chamadas de API do modelo, sem incluir promoções por tempo limitado. Acesse o Console do Model Studio para consultar ofertas promocionais.
  • China (Beijing)
  • Singapore
  • Germany (Frankfurt)
  • US (Virginia)

Item de faturamento

Preço (USD)

Unidade

Entrada

0,022

Por 1M tokens

Saída

0,215

Por 1M tokens

Entrada (Cache implícito)

0,005

Por 1M tokens

Entrada (Arquivo em lote)

0,011

Por 1M tokens

Saída (Arquivo em lote)

0,108

Por 1M tokens

Criação de cache explícito

0,028

Por 1M tokens

Leitura de cache explícito

0,002

Por 1M tokens

Entrada (Chat em lote)

0,022

Por 1M tokens

Saída (Chat em lote)

0,215

Por 1M tokens

Item de faturamento

Preço (USD)

Unidade

Entrada

0,043

Por 1M tokens

Saída

0,43

Por 1M tokens

Entrada (Cache implícito)

0,009

Por 1M tokens

Entrada (Arquivo em lote)

0,022

Por 1M tokens

Saída (Arquivo em lote)

0,215

Por 1M tokens

Criação de cache explícito

0,054

Por 1M tokens

Leitura de cache explícito

0,004

Por 1M tokens

Entrada (Chat em lote)

0,043

Por 1M tokens

Saída (Chat em lote)

0,43

Por 1M tokens

Item de faturamento

Preço (USD)

Unidade

Entrada

0,086

Por 1M tokens

Saída

0,859

Por 1M tokens

Entrada (Cache implícito)

0,018

Por 1M tokens

Entrada (Arquivo em lote)

0,043

Por 1M tokens

Saída (Arquivo em lote)

0,43

Por 1M tokens

Criação de cache explícito

0,108

Por 1M tokens

Leitura de cache explícito

0,009

Por 1M tokens

Entrada (Chat em lote)

0,086

Por 1M tokens

Saída (Chat em lote)

0,859

Por 1M tokens

Limites de taxa

  • China (Beijing)
  • Singapore
  • Germany (Frankfurt)
  • US (Virginia)

Parâmetro

Valor

RPM (Requisições por minuto)

3000

TPM (Tokens por minuto)

5.000.000

Versões de snapshot

qwen3-vl-flash-2026-01-22

A série Qwen3 de modelos de compreensão visual de pequeno porte integra eficazmente os modos de raciocínio e não raciocínio. Em comparação com o snapshot de 15 de outubro de 2025, o desempenho geral do modelo melhorou significativamente: oferece capacidades aprimoradas de reconhecimento visual geral e raciocínio, além de apresentar melhorias marcantes na precisão de reconhecimento em vários cenários de negócios, como segurança, inspeções em lojas, monitoramento de equipamentos e resolução de problemas baseada em fotos. Esta versão é um snapshot de 22 de janeiro de 2026.

Provedor de service de inferência

O provedor de service de inferência para qwen3-vl-flash-2026-01-22 é o Alibaba Cloud Model Studio.

Capacidades do modelo

Capacidade

Suporte

Capacidade

Suporte

Modalidade de entrada

Text Image Video

Modalidade de saída

Text

Experiência do modelo

Supported

Function Calling

Unsupported

Saídas estruturadas

Unsupported

Pesquisa na web

Unsupported

Conclusão de prefixo

Unsupported

Cache de contexto

Unsupported

Inferência em lote

Unsupported

Ajuste fino

Unsupported

Limites de contexto

Parâmetro

Valor

Parâmetro

Valor

Comprimento máximo de entrada

258048

Comprimento máximo de saída

32768

Janela de contexto

262144

Comprimento máximo de entrada (Modo de raciocínio)

258048

Comprimento máximo de saída (Modo de raciocínio)

32768

Comprimento máximo da cadeia de pensamento

81920

Preços

Esta página exibe apenas os preços originais para chamadas de API do modelo, sem incluir promoções por tempo limitado. Acesse o Console do Model Studio para consultar ofertas promocionais.
  • China (Beijing)
  • Singapore
  • Germany (Frankfurt)

Item de faturamento

Preço (USD)

Unidade

Entrada

0,022

Por 1M tokens

Saída

0,215

Por 1M tokens

Item de faturamento

Preço (USD)

Unidade

Entrada

0,043

Por 1M tokens

Saída

0,43

Por 1M tokens

Item de faturamento

Preço (USD)

Unidade

Entrada

0,086

Por 1M tokens

Saída

0,859

Por 1M tokens

Limites de taxa

  • China (Beijing)
  • Singapore
  • Germany (Frankfurt)

Parâmetro

Valor

RPM (Requisições por minuto)

60

TPM (Tokens por minuto)

100.000

qwen3-vl-flash-2025-10-15

A série Qwen3 de modelos de compreensão visual de pequena escala integra eficazmente os modos de raciocínio e não raciocínio. Oferece desempenho superior ao modelo open-source Qwen3-VL-30B-A3B, mantendo respostas rápidas. O modelo apresenta uma atualização abrangente na compreensão de imagens e vídeos, com suporte a contextos extremamente longos (como vídeos extensos e documentos), percepção espacial e reconhecimento de objetos em diversos domínios. Com capacidades de localização visual 2D/3D, é ideal para tarefas complexas do mundo real. Esta versão é um snapshot de 15 de outubro de 2025.

Provedor de service de inferência

O provedor de service de inferência para qwen3-vl-flash-2025-10-15 é o Alibaba Cloud Model Studio.

Capacidades do modelo

  • China (Beijing)
  • Singapore
  • Germany (Frankfurt)
  • US (Virginia)

Capacidade

Suporte

Capacidade

Suporte

Modalidade de entrada

Text Image Video

Modalidade de saída

Text

Experiência do modelo

Supported

Function Calling

Supported

Saídas estruturadas

Supported

Pesquisa na web

Unsupported

Conclusão de prefixo

Supported

Cache de contexto

Unsupported

Inferência em lote

Unsupported

Ajuste fino

Unsupported

Limites de contexto

Parâmetro

Valor

Parâmetro

Valor

Comprimento máximo de entrada

260096

Comprimento máximo de saída

32768

Janela de contexto

262144

Comprimento máximo de entrada (Modo de raciocínio)

258048

Comprimento máximo de saída (Modo de raciocínio)

32768

Comprimento máximo da cadeia de pensamento

81920

Preços

Esta página exibe apenas os preços originais para chamadas de API do modelo, sem incluir promoções por tempo limitado. Acesse o Console do Model Studio para consultar ofertas promocionais.
  • China (Beijing)
  • Singapore
  • Germany (Frankfurt)
  • US (Virginia)

Item de faturamento

Preço (USD)

Unidade

Entrada

0,022

Por 1M tokens

Saída

0,215

Por 1M tokens

Item de faturamento

Preço (USD)

Unidade

Entrada

0,043

Por 1M tokens

Saída

0,43

Por 1M tokens

Item de faturamento

Preço (USD)

Unidade

Entrada

0,086

Por 1M tokens

Saída

0,859

Por 1M tokens

Limites de taxa

  • China (Beijing)
  • Singapore
  • Germany (Frankfurt)
  • US (Virginia)

Parâmetro

Valor

RPM (Requisições por minuto)

60

TPM (Tokens por minuto)

100.000

Plano de Tokens
Playground de Modelos
  • Music generation
Inferência do Modelo
Avaliação
Compressão de Modelos
Estatísticas e Monitoramento