Os modelos de compreensão visual respondem a perguntas com base nas imagens ou vídeos fornecidos por você. Eles aceitam entrada de uma ou várias imagens e são adequados para diversas tarefas, como geração de legendas para imagens, resposta a perguntas visuais e localização de objetos.
Primeiros passos
Pré-requisitos
- Obter uma chave de API e configurá-la como variável de ambiente.
- Para fazer chamadas usando um SDK, instale o SDK. O DashScope Python SDK deve ser versão 1.24.6 ou posterior, e o DashScope Java SDK deve ser versão 2.21.10 ou posterior.
- OpenAI compatible
- DashScope
- Python
- Node.js
- Java
- curl
Resposta
Desempenho do modelo
Perguntas e respostas sobre imagens
Descreva o conteúdo de uma imagem ou classifique e rotule seus elementos, identificando pessoas, lugares, animais e plantas.
![]() Qual item desta imagem devo usar se o sol estiver muito forte? | Se o sol estiver muito forte, você deve usar os óculos de sol rosa da imagem. Óculos de sol bloqueiam eficazmente a luz intensa, reduzem os danos causados pelos raios UV aos olhos e ajudam a proteger sua visão, melhorando o conforto visual sob luz solar brilhante. |
|---|
Escrita criativa
Gere descrições de texto vívidas com base no conteúdo de imagens ou vídeos. Ideal para cenários criativos como redação de histórias, copywriting e roteiros de vídeos curtos.
![]() Por favor, escreva uma postagem interessante para redes sociais com base no conteúdo da imagem. | Claro. Esta imagem é repleta de uma rica atmosfera do Festival de Meio Outono, combinando habilmente elementos clássicos e modernos. Com base nos principais elementos da imagem, preparei várias postagens para redes sociais em diferentes estilos para você escolher. Estilo poético e belo Hoje à noite, a lua brilha para todos verem, mas quem sabe onde cairão os pensamentos de outono? Chang'e voa para a lua e o Coelho de Jade prepara remédios. O romantismo dos antigos se ilumina nesta noite. Que esta lua brilhante ilumine seu caminho de volta para casa e carregue meus pensamentos mais profundos. Feliz Festival de Meio Outono! Estilo de votos calorosos A lua está cheia e as famílias se reencontram. A noite do Meio Outono é a mais gentil. Veja os fogos de artifício florescerem, admire a lua cheia no céu, dê uma mordida em um bolo lunar e deseje boa saúde. Que tudo o que desejamos se torne realidade. Feliz Festival de Meio Outono a todos, e que suas famílias sejam felizes! |
Reconhecimento de texto e extração de informações
Reconheça textos e fórmulas em imagens ou extraia informações de recibos, certificados e formulários. Oferece suporte à saída de texto formatado.
![]() Extraia o seguinte da imagem: ['Invoice Code', 'Invoice Number', 'Destination', 'Fuel Surcharge', 'Fare', 'Date', 'Departure Time', 'Train Number', 'Seat Number']. Por favor, forneça a saída no formato JSON. | { "Invoice Code": "221021325353", "Invoice Number": "10283819", "Destination": "Development Zone", "Fuel Surcharge": "2.0", "Fare": "8.00<Full>", "Date": "2013-06-29", "Departure Time": "Rolling", "Train Number": "040", "Seat Number": "371" } |
Resolução de problemas multidisciplinares
Resolva problemas de matemática, física, química e outras disciplinas presentes em imagens. Adequado para ensino fundamental, médio, universitário e educação de adultos.
![]() Resolva o problema de matemática na imagem passo a passo. | ![]() |
|---|
Programação visual
Gere código a partir de imagens ou vídeos. Use este recurso para criar códigos HTML, CSS e JS a partir de rascunhos de design, capturas de tela de sites, entre outros.
Crie uma página web usando HTML e CSS com base no meu esboço. A cor principal deve ser preta. |
Visualização da página web |
|---|
Localização de objetos
Oferece suporte à localização 2D e 3D. Utilize este recurso para determinar a orientação de objetos, mudanças de perspectiva e relações de oclusão. A localização 3D é uma nova capacidade adicionada ao modelo Qwen3-VL.
O desempenho de localização de objetos do modelo Qwen2.5-VL é robusto dentro da faixa de resolução de 480 × 480 a 2560 × 2560. Fora dessa faixa, a precisão da detecção pode diminuir, com desvios ocasionais nos quadros de detecção.
Para obter informações sobre como desenhar os resultados de localização na imagem original, consulte FAQ .
Localização 2D![]()
| Visualização dos resultados de localização 2D![]() |
Localização 3D ![]() [{"bbox_3d": [x_center, y_center, z_center, x_size, y_size, z_size, roll, pitch, yaw], "label": "category"}]. |
Visualização dos resultados de localização 3D ![]() |
Análise de documentos
Analise documentos baseados em imagens (como cópias digitalizadas ou PDFs de imagem) para os formatos QwenVL HTML ou QwenVL Markdown. Esse formato não apenas reconhece o texto com precisão, mas também obtém informações de posição de elementos como imagens e tabelas. O modelo Qwen3-VL adiciona a capacidade de análise para o formato Markdown.
Os prompts recomendados são os seguintes:qwenvl html(para analisar no formato HTML) ouqwenvl markdown(para analisar no formato Markdown).
qwenvl markdown. |
Visualização dos resultados |
|---|
Compreensão de vídeo
Analise o conteúdo de vídeo, localizando eventos específicos e obtendo carimbos de data/hora, ou gerando resumos de períodos-chave.
| Descreva a série de ações da pessoa no vídeo. Forneça a hora de início (start_time), hora de término (end_time) e evento (event) no formato JSON. Use HH:mm:ss para o carimbo de data/hora. | {"events": [{"start_time": "00:00:00","end_time": "00:00:05","event": "The person walks towards the table holding a cardboard box and places it on the table."},{"start_time": "00:00:05","end_time": "00:00:15","event": "The person picks up a scanner and scans the label on the cardboard box."},{"start_time": "00:00:15","end_time": "00:00:21","event": "The person puts the scanner back in its place and then picks up a pen to record information in a notebook."}]} |
Recursos principais
Ativar ou desativar o modo de pensamento
-
Os modelos das séries
qwen3.8,qwen3.7,qwen3.6,qwen3.5,qwen3-vl-pluseqwen3-vl-flashsão modelos de pensamento híbrido. Eles podem pensar antes de responder ou gerar a resposta diretamente. Use o parâmetroenable_thinkingpara controlar a ativação do modo de pensamento:true: Ativa o modo de pensamento. O valor padrão para os modelos das sériesqwen3.8,qwen3.7,qwen3.6eqwen3.5étrue.false: Desativa o modo de pensamento. O valor padrão para os modelos das sériesqwen3-vl-pluseqwen3-vl-flashéfalse.
-
Modelos com o sufixo
thinking, comoqwen3-vl-235b-a22b-thinking, operam exclusivamente com pensamento. Eles sempre raciocinam antes de responder e não é possível desativar esse comportamento.
- OpenAI compatible
- DashScope
enable_thinking não faz parte do padrão OpenAI. Caso utilize o SDK Python da OpenAI, passe-o por meio de extra_body.Entradas com múltiplas imagens
Os modelos de compreensão visual aceitam o envio de várias imagens em uma única requisição, permitindo realizar tarefas como comparação de produtos e processamento de documentos multipáginas. Para isso, basta incluir múltiplos objetos de imagem no array content da user message.
- OpenAI compatible
- DashScope
- Python
- Node.js
- curl
Resposta
Compreensão de vídeo
Os modelos de compreensão visual analisam o conteúdo de vídeo fornecido como uma lista de imagens (frames de vídeo) ou como um arquivo de vídeo. Os exemplos a seguir demonstram como processar vídeos online ou listas de imagens especificadas por uma URL. Para obter mais informações sobre os limites de vídeo ou a quantidade de imagens permitidas em uma lista, consulte Limites de vídeo.
Para obter melhor desempenho ao analisar arquivos de vídeo, utilize as versões de snapshot mais recentes ou atualizadas dos modelos.
- Arquivos de vídeo
- Lista de imagens
-
fps: Controla a frequência de extração de frames. Um frame é extraído a cada 1/fps segundos. O intervalo de valores é [0.1, 10], e o valor padrão é 2.0.
- Em cenas com movimento rápido, defina um valor de fps mais alto para capturar mais detalhes.
- Para cenas estáticas ou vídeos longos, defina um valor de fps mais baixo para melhorar o desempenho.
- max_frames: Número máximo de frames a serem extraídos de um vídeo. O sistema calcula o total de frames com base no fps do vídeo. Caso o número total ultrapasse esse limite, o sistema amostra os frames uniformemente de forma automática para respeitar o limite. Este parâmetro está disponível apenas ao usar o DashScope SDK.
- Compatível com OpenAI
- DashScope
Ao enviar um arquivo de vídeo diretamente para o modelo de compreensão visual usando o OpenAI SDK ou HTTP, defina o parâmetro"type"na mensagem do usuário como"video_url".
Enviar um arquivo local (codificação Base64 ou caminho do arquivo)
Os modelos de compreensão visual aceitam dois métodos para envio de arquivos locais: codificação Base64 e upload direto pelo caminho do arquivo. Escolha o método mais adequado com base no tamanho do arquivo e no tipo de SDK. Para recomendações, consulte Como escolher um método de upload de arquivo. Ambos os métodos devem atender aos requisitos de arquivo descritos em Limitações de imagem.
- Upload usando codificação Base64
- Upload usando o caminho do arquivo
Etapas para enviar uma string codificada em Base64 (exemplo com imagem)
Etapas para enviar uma string codificada em Base64 (exemplo com imagem)
-
Codifique o arquivo: converta a imagem local para codificação Base64.
Código de exemplo para converter uma imagem em codificação Base64
-
Construa uma Data URL no seguinte formato:
data:[MIME_type];base64,{base64_image}.- Substitua
MIME_typepelo tipo de mídia real. Verifique se ele corresponde ao valor deMIME Typena tabela Formatos de imagem suportados, comoimage/jpegouimage/png. base64_imageé a string Base64 gerada na etapa anterior.
- Substitua
-
Chame o modelo: passe a
Data URLusando o parâmetroimageouimage_url.
- Imagem
- Arquivo de vídeo
- Lista de imagens
- Passar usando um caminho de arquivo
- Entrada codificada em Base64
Processamento de imagens de alta resolução
A API do modelo de compreensão visual possui um limite de tokens visuais para cada imagem codificada. Nas configurações padrão, imagens de alta resolução são compactadas, o que pode causar perda de detalhes e reduzir a precisão da compreensão. Para preservar mais detalhes e melhorar a análise, ative vl_high_resolution_images ou ajuste max_pixels e aumente a quantidade de tokens visuais.
Visualize os pixels por token visual, o limite de tokens e o limite de pixels para cada modelo
Visualize os pixels por token visual, o limite de tokens e o limite de pixels para cada modelo
Se a contagem de pixels da imagem de entrada exceder o limite de pixels do modelo, a imagem será reduzida para caber dentro desse limite.
Modelo | Pixels por token | vl_high_resolution_images | max_pixels | Limite de tokens | Limite de pixels |
Modelos das séries |
|
|
|
|
|
| Personalizável. O valor padrão é | Determinado por |
| ||
|
|
|
|
|
|
| Personalizável. O valor padrão é | Determinado por |
| ||
Outros modelos |
|
|
|
|
|
| Personalizável. O valor padrão é | Determinado por |
|
-
Quando
vl_high_resolution_images=true, a API aplica uma política de resolução fixa e ignora a configuraçãomax_pixels. Essa opção é ideal para reconhecer textos finos, objetos pequenos ou imagens com muitos detalhes. -
Se
vl_high_resolution_images=false, o limite final de pixels dependerá do valor do parâmetromax_pixels.- Em cenários sensíveis a custos, nos quais você deseja reduzir o consumo de tokens visuais: utilize o valor padrão de
max_pixelsou defina um valor menor. O parâmetromax_pixelsafeta principalmente a quantidade de tokens visuais e o custo da chamada. Em nossos testes, reduzi-lo não teve impacto significativo no tempo de resposta de ponta a ponta. Para diminuir a latência, consulte Velocidade de resposta e seleção de modelo. - Caso precise focar em detalhes específicos e possa aceitar uma velocidade de processamento menor, aumente o valor de
max_pixelsconforme necessário.
- Em cenários sensíveis a custos, nos quais você deseja reduzir o consumo de tokens visuais: utilize o valor padrão de
Velocidade de resposta e seleção de modelo
Em cenários sensíveis à latência, o tempo de resposta depende principalmente do modelo escolhido, e não do parâmetro max_pixels. A tabela a seguir compara os tempos de resposta de qwen-vl-max e qwen-vl-plus nas mesmas condições de entrada:
Modelo | Tempo médio de resposta | Características |
|---|---|---|
| Cerca de 12 s | Reconhecimento de alta precisão. Recomendado para imagens com muitos detalhes e baixa tolerância a erros. |
| Cerca de 8 s | Equilíbrio entre velocidade e precisão. Aproximadamente 39% mais rápido que |
qwen-vl-max: 12,75 s e 11,84 s, média de 12,29 s; qwen-vl-plus: 8,29 s e 6,75 s, média de 7,52 s). A latência real varia conforme o tamanho da imagem, o comprimento da saída e as condições da rede. Esses valores servem apenas como referência e não constituem um compromisso de desempenho.
- Ativar a saída em streaming (
stream=True) reduz significativamente o tempo até o primeiro token: na mesma solicitação, o primeiro token retorna em cerca de 0,95 segundo, enquanto o tempo total da resposta completa permanece inalterado. Essa abordagem é adequada para cenários interativos que exigem feedback o mais cedo possível. - Para cenários de reconhecimento de imagens sensíveis à latência, como fluxos de trabalho: use
qwen-vl-pluscomstream=Truepara obter o primeiro token em aproximadamente 1 segundo. Mude paraqwen-vl-maxsomente se a precisão de reconhecimento doqwen-vl-plusnão atender aos seus requisitos. Ajustarmax_pixelsnão é uma forma eficaz de aumentar a velocidade.
- OpenAI compatible
- DashScope
vl_high_resolution_images não faz parte do padrão OpenAI. A forma de passá-lo varia entre os diferentes SDKs de linguagem:- Python SDK: Deve ser transmitido por meio do dicionário
extra_body. - Node.js SDK: Pode ser passado diretamente como um parâmetro de nível superior.
- Python
- Node.js
- curl
Mais casos de uso
Limites
Limites de arquivos de entrada
- Limites de imagem
- Limites de vídeo
-
Resolução da imagem:
-
Tamanho mínimo: a largura e a altura da imagem devem ser maiores que
10pixels. -
Proporção: a razão entre o lado maior e o menor, tanto na imagem original quanto na redimensionada, não pode ultrapassar
200:1.Para detalhes sobre a lógica de redimensionamento de imagens, consulte a função
smart_resizeem Calcular tokens de imagem -
Máximo de pixels:
- Mantenha a resolução da imagem dentro de
8K (7680x4320). Resoluções superiores podem causar timeouts na chamada da API devido ao tamanho grande dos arquivos e ao tempo prolongado de transmissão pela rede. - Redimensionamento automático: o modelo ajusta o tamanho da imagem usando
max_pixelsemin_pixels. Fornecer imagens de altíssima resolução não melhora a precisão da detecção; pelo contrário, aumenta o risco de falhas nas chamadas. Redimensione as imagens para um tamanho adequado no cliente antes de fazer o upload.
- Mantenha a resolução da imagem dentro de
-
Tamanho mínimo: a largura e a altura da imagem devem ser maiores que
-
Formatos de imagem suportados
-
Para resoluções abaixo de 4K
(3840x2160), os seguintes formatos são aceitos:Formato de imagem
Extensões comuns
Tipo MIME
BMP
.bmp
image/bmp
JPEG
.jpe, .jpeg, .jpg
image/jpeg
PNG
.png
image/png
TIFF
.tif, .tiff
image/tiff
WEBP
.webp
image/webp
HEIC
.heic
image/heic
-
Para resoluções entre
4K (3840x2160)e8K (7680x4320), apenas os formatos JPEG, JPG e PNG são suportados.
-
Para resoluções abaixo de 4K
-
Tamanho da imagem:
Os limites abaixo se aplicam a cada imagem individualmente. Em entradas com múltiplas imagens, cada uma é avaliada de forma independente, sem soma dos tamanhos.
- Via URL pública: uma única imagem não pode exceder
20 MBpara modelos das séries Qwen3.8, Qwen3.7, Qwen3.6, Qwen3.5 e Qwen3-VL. Para os demais modelos, o limite por imagem é de10 MB. - Via caminho local: uma única imagem não pode ultrapassar
10 MB. - Via codificação Base64 (API compatível com OpenAI): para as séries Qwen3.8, Qwen3.7, Qwen3.6, Qwen3.5 e Qwen3-VL, o arquivo original antes da codificação não pode passar de
20 MB. Nos outros modelos, o limite é10 MB. Em ambos os casos, a string Data URI resultante não pode exceder20 MB. - Via codificação Base64 (API compatível com Anthropic): o corpo total da requisição não pode ultrapassar6 MB. Ao enviar várias imagens, elas compartilham essa cota.
Para compactar um arquivo, consulte Como compactar uma imagem ou vídeo para o tamanho necessário .
- Via URL pública: uma única imagem não pode exceder
-
Quantidade de imagens: o número máximo de imagens suportado em entradas múltiplas varia conforme o método de envio:
-
Via URLs públicas ou caminhos locais:
- Séries Qwen3.8-Max e Qwen3.7-Plus: até 2.048 imagens
- Séries Qwen3.7-Flash, Qwen3.6-Plus, Qwen3.6-Flash, Qwen3.5-Plus, Qwen3.5-Flash, Qwen3-VL, Qwen-VL e QVQ: até 256 imagens
- Para a série Qwen-Omni, consulte Omni-modal.
- Via strings codificadas em Base64: até 250 imagens
-
Via URLs públicas ou caminhos locais:
O total de tokens de todas as imagens também está sujeito ao limite máximo de tokens de entrada do modelo. A soma dos tokens de todas as imagens e textos não deve exceder a capacidade máxima de entrada do modelo.
Métodos de entrada de arquivos
-
URL pública: forneça um endereço de arquivo acessível publicamente que suporte o protocolo HTTP ou HTTPS. Para garantir melhor estabilidade e desempenho, faça upload do arquivo no OSS e obtenha uma URL pública. O Model Studio não consegue acessar endpoints internos do OSS, cujos endereços contêm
-internal, comohttps://<bucket>.oss-cn-hangzhou-internal.aliyuncs.com/image.jpg. Se você usar um endereço interno, o download do arquivo falhará eInvalidParameterserá retornado com a mensagemFailed to download multimodal content. Utilize um endpoint público do OSS, comohttps://<bucket>.oss-cn-hangzhou.aliyuncs.com/image.jpg, ou uma URL pré-assinada do OSS. - Codificação Base64: converta o arquivo para uma string codificada em Base64 e envie-o.
- Caminho de arquivo local (apenas DashScope SDK): informe o caminho de um arquivo local.
Para recomendações sobre como escolher o método de entrada de arquivos, consulte Como escolher um método de upload de arquivo?
Uso em ambiente de produção
- Pré-processamento de imagens e vídeos: Os modelos de compreensão visual possuem limites de tamanho para arquivos de entrada. Para compactar arquivos, consulte Métodos de compactação de imagem ou vídeo.
-
Processamento de arquivos de texto: Os modelos de compreensão visual aceitam apenas arquivos de imagem e vídeo. Eles não processam TXT, Word (.doc/.docx), PDF ou outros formatos baseados em texto. Utilize uma das seguintes alternativas:
- Converta o arquivo de texto para um formato de imagem. Use uma biblioteca de processamento de imagens, como pdf2image para Python, para converter cada página do arquivo em várias imagens de alta qualidade. Em seguida, envie as imagens ao modelo por meio do método de entrada de múltiplas imagens.
- Utilize o Qwen-Long, que permite o upload de documentos e a realização de conversas mediante a passagem de informações via
file-id.
-
Tolerância a falhas e estabilidade
- Tratamento de timeout: Em chamadas sem streaming, ocorre um erro de timeout caso o modelo não termine de gerar a saída dentro de 300 segundos. Quando isso acontece, o conteúdo já gerado é retornado no corpo da resposta. Um cabeçalho de resposta contendo
x-dashscope-partialresponse: trueindica que houve timeout. Utilize o recurso de modo parcial, disponível em alguns modelos. Adicione o conteúdo gerado ao arraymessagese reenvie a solicitação para que o Large Language Model (LLM) continue a geração. Para mais detalhes, consulte Continuar a geração a partir de uma saída incompleta. - Configuração de timeout no cliente: O timeout mencionado acima ocorre no servidor quando o modelo ultrapassa 300 segundos na geração da saída. Esse comportamento difere do timeout padrão configurado no SDK do lado do cliente. Ao processar imagens grandes, como uma de 4000 x 4000 pixels, a requisição pode exceder o limite padrão do SDK e ser interrompida com um
APITimeoutError, mesmo que o limite de 300 segundos do servidor não tenha sido atingido. Para evitar esse problema, usewith_optionsno SDK Python da OpenAI para aumentar o timeout do cliente:
- Tratamento de timeout: Em chamadas sem streaming, ocorre um erro de timeout caso o modelo não termine de gerar a saída dentro de 300 segundos. Quando isso acontece, o conteúdo já gerado é retornado no corpo da resposta. Um cabeçalho de resposta contendo
- Saída em streaming: Defina
stream=Truepara que o modelo retorne o conteúdo incrementalmente, em vez de aguardar uma resposta completa única. Essa configuração evita timeouts no cliente causados por chamadas longas sem streaming durante o processamento de imagens grandes:
- Mecanismo de nova tentativa: Implemente uma lógica adequada de repetição de chamadas de API, como backoff exponencial, para lidar com instabilidades de rede ou indisponibilidade temporária do serviço.
Faturamento e limitação de taxa
-
Faturamento:O custo total é calculado com base na quantidade total de tokens de entrada e saída. Os preços de entrada e saída estão disponíveis no console do Model Studio.
- Composição dos tokens:Os tokens de entrada incluem tokens de texto e tokens convertidos a partir de imagens ou vídeos. Os tokens de saída correspondem ao texto gerado pelo modelo. No modo de pensamento, o processo de raciocínio do modelo também é contabilizado como tokens de saída. Caso o processo de pensamento não seja exibido nesse modo, o faturamento segue a tabela de preços do modo sem pensamento.
-
Cálculo de tokens para imagens e vídeos:Utilize o código abaixo para estimar o consumo de tokens de imagens ou vídeos. O resultado é apenas uma referência; o uso real consta na resposta da API.
Calcular tokens para imagens e vídeos
- Imagens
- Vídeos
Fórmula:Image Tokens = h_bar * w_bar / token_pixels + 2-
h_bar, w_bar: Altura e largura da imagem redimensionada. Antes de processar uma imagem, o modelo executa um pré-processamento para reduzi-la até um limite específico de pixels. Esse limite depende dos valores dos parâmetrosmax_pixelsevl_high_resolution_images. Para mais informações, consulte Processar imagens de alta resolução. -
token_pixels: Valor em pixels correspondente a cadatokenvisual. Esse valor varia conforme o modelo:qwen3.8-series,qwen3.7-series,qwen3.6-series,qwen3.5-series,Qwen3-VL,qwen-vl-maxeqwen-vl-plus:Cadatokencorresponde a32x32pixels.QVQe demais modelosQwen2.5-VL:Cada token corresponde a28x28pixels.
- Visualizar faturas:Consulte suas faturas ou recarregue sua conta na página Expenses and Costs do Alibaba Cloud Management Console.
- Limitação de taxa:Para mais detalhes sobre as condições de limitação de taxa dos modelos de compreensão visual, consulte Limitação de taxa.
- Cota gratuita(apenas região Singapore): Uma cota gratuita de 1 milhão de tokens está disponível para os modelos de compreensão visual. O período de validade de 90 dias começa na data em que você ativa o Model Studio ou tem sua solicitação de modelo aprovada.
Instruções
- Leia o conteúdo em inglês para compreender O QUE precisa ser comunicado
- Escreva o português brasileiro DO ZERO — esqueça a estrutura das frases em inglês
- Preserve toda a formatação markdown, blocos de código, links e imagens exatamente como estão
- Copie os placeholders xref (
{XREF_N}) literalmente, sem traduzir ou modificar - Aplique todas as regras específicas do idioma rigorosamente
- Aplique as regras de stopwords com tolerância zero
- Use o modo imperativo em passos numerados e listas de procedimentos
- Garanta a consistência terminológica — o mesmo termo deve ter a mesma tradução em todo o documento
- Varie os inícios de frase em listas e tabelas — nenhum início deve se repetir mais de 3 vezes
- Retorne APENAS o documento markdown em português brasileiro, sem explicações
Referência da API
Para obter mais informações sobre os parâmetros de entrada e saída do modelo de compreensão visual, consulte geração de texto.
Perguntas frequentes
Como escolher um método de upload de arquivo?
Como escolher um método de upload de arquivo?
Tipo de arquivo | Especificações do arquivo | DashScope SDK (Python, Java) | Compatível com OpenAI / DashScope HTTP |
|---|---|---|---|
Imagem | Maior que 7 MB e menor que 10 MB | Informe o caminho local | Somente URLs de rede pública são suportadas. Utilize o Alibaba Cloud Object Storage Service |
Menor que 7 MB | Informe o caminho local | Codificação Base64 | |
Vídeo | Maior que 100 MB | Somente URLs de rede pública são suportadas. Utilize o Alibaba Cloud Object Storage Service | Somente URLs de rede pública são suportadas. Utilize o Alibaba Cloud Object Storage Service |
Maior que 7 MB e menor que 100 MB | Informe o caminho local | Somente URLs de rede pública são suportadas. Utilize o Alibaba Cloud Object Storage Service | |
Menor que 7 MB | Informe o caminho local | Codificação Base64 |
A codificação Base64 aumenta o tamanho dos dados. O arquivo original deve ter menos de 7 MB.
Utilize Base64 ou um caminho local para evitar tempos limite de download no servidor e melhorar a estabilidade.
Como compactar uma imagem ou vídeo para o tamanho necessário?
Como compactar uma imagem ou vídeo para o tamanho necessário?
Métodos de compactação de imagens
Métodos de compactação de imagens
- Ferramentas online: Utilize ferramentas como CompressJPEG para compactar imagens.
- Software local: Utilize softwares como Photoshop para ajustar a qualidade durante a exportação.
- Implementação via código:
Métodos de compactação de vídeos
Métodos de compactação de vídeos
- Ferramentas online: Utilize ferramentas como FreeConvert para compactar vídeos.
- Software local: Utilize softwares como HandBrake.
- Implementação via código: Utilize a ferramenta FFmpeg. Para mais informações, consulte o site oficial do FFmpeg.
Após o modelo gerar resultados de localização de objetos, como desenhar quadros de detecção na imagem original?
Após o modelo gerar resultados de localização de objetos, como desenhar quadros de detecção na imagem original?
- Qwen2.5-VL: As coordenadas retornadas são valores absolutos em pixels, relativos ao canto superior esquerdo da imagem redimensionada. Para desenhar quadros de detecção, consulte o código em qwen2_5_vl_2d.py.
- Séries Qwen3-VL, Qwen3.5, Qwen3.6 e Qwen3.7 (como qwen3.5-plus, qwen3.6-plus e qwen3.7-plus): As coordenadas retornadas são relativas e normalizadas no intervalo
[0, 999]. Para desenhar quadros de detecção, consulte o código em qwen3_vl_2d.py (localização 2D) ou qwen3_vl_3d.zip (localização 3D).












