O Qwen-OCR é um modelo de compreensão visual que extrai texto e dados estruturados de imagens, como documentos digitalizados, tabelas, recibos, entre outros. Ele processa vários idiomas e suporta tarefas avançadas de OCR: extração de informações, análise de tabelas, reconhecimento de fórmulas e interpretação de documentos.
Exemplos
| Imagem de entrada | Resultado do reconhecimento |
|---|---|
Reconhecimento de múltiplos idiomas![]() | INTERNATIONALMOTHER LANGUAGEDAYПривет!你好!Bonjour!Merhaba!Ciao!Hello!Ola!בר מולדSalam! |
Reconhecimento de imagens inclinadas![]() | Product IntroductionImported fiber filaments from South Korea.6941990612023Item No.: 2023 |
Localização da posição do texto![]() A tarefa high-precision recognition oferece suporte à localização de texto. | Visualização da localização![]() Consulte FAQ para saber como desenhar a caixa delimitadora de cada linha de texto sobre a imagem original. |
Seleção de modelo
O Qwen-OCR oferece os modelos listados abaixo. Escolha aquele que melhor atende aos requisitos do seu negócio:
- Qwen3.5-OCR: Baseado na arquitetura Qwen3.5, com atualizações abrangentes em análise de documentos, localização de texto e extração de informações-chave. Oferece suporte a conversas de múltiplas turnos e análise de documentos PDF. Apresenta melhorias significativas na extração de dados de certificados oficiais (como carteiras de identidade e habilitação). Para verificar os tipos de certificados suportados, consulte Supported certificate and document types. Inclui o modelo
qwen3.5-ocr. - Qwen-VL-OCR: Desenvolvido sobre a arquitetura Qwen3-VL. Suporta tarefas integradas como análise de documentos, localização de texto (reconhecimento de alta precisão), extração de informações, análise de tabelas, reconhecimento de fórmulas, reconhecimento geral de texto e suporte multilíngue. Também corrige automaticamente a rotação de imagens. Abrange os modelos
qwen-vl-ocr(estável),qwen-vl-ocr-latest(mais recente),qwen-vl-ocr-2025-11-20eqwen-vl-ocr-2025-08-28. - Versões anteriores (não recomendadas): Estas versões são inferiores aos modelos mais recentes tanto em recursos quanto em desempenho. Recomendamos a migração para o
qwen3.5-ocr. Esta categoria inclui os modelosqwen-vl-ocr-2025-04-13eqwen-vl-ocr-2024-10-28.
Nos modelosExperiência online: Visite o console do Model Studio, selecione a região desejada no canto superior direito e acesse a seção Vision Models para testar os modelos Qwen-OCR.qwen-vl-ocr, qwen-vl-ocr-2025-04-13 e qwen-vl-ocr-2025-08-28, o parâmetromax_tokens(comprimento máximo de saída) tem como padrão 4096. Para aumentar esse valor para uma faixa entre 4097 e 8192, entre em contato com seu gerente comercial e forneça as seguintes informações: ID da sua conta Alibaba Cloud, tipo de imagem (como documentos, e-commerce ou contratos), nome do modelo, estimativa de Consultas Por Segundo (QPS) e total diário de requisições, além da porcentagem de requisições em que a saída do modelo excede 4096 tokens.
Preparativos
- Create an API key e set it as an environment variable.
-
Caso utilize o OpenAI SDK ou DashScope SDK, siga as instruções em install the latest SDK version. Versões mínimas exigidas: DashScope Python SDK 1.22.2, Java SDK 2.21.8.
-
DashScope SDK
- Vantagens: Acesso completo a recursos avançados — correção de rotação de imagem e tarefas nativas de OCR — por meio de uma API simples.
- Mais indicado para: Projetos que necessitam do conjunto completo de funcionalidades.
-
SDK compatível com OpenAI
- Vantagens: Substituição direta para integrações existentes baseadas no OpenAI SDK.
- Limitações: Recursos avançados, como correção de rotação e tarefas integradas de OCR, não estão expostos diretamente como parâmetros. É necessário simulá-los através da elaboração cuidadosa de prompts e da análise da saída gerada.
- Recomendado quando: O projeto já utiliza OpenAI e não depende de funcionalidades exclusivas do DashScope.
-
DashScope SDK
Primeiros passos
O exemplo a seguir extrai campos estruturados de uma imagem de bilhete de trem (URL) e retorna os resultados em formato JSON. Para arquivos locais, consulte how to pass a local file. Para restrições de entrada, consulte image limitations.
- OpenAI compatible-Chat
- OpenAI compatible-Response
- DashScope
Exemplo de resposta
Exemplo de resposta
Chamar tarefas integradas
Os modelos (exceto qwen-vl-ocr-2024-10-28) incluem tarefas integradas para cenários comuns de OCR.
Como chamar uma tarefa integrada:
- DashScope SDK: Defina o parâmetro
ocr_optionspara invocar as tarefas integradas. A partir do modeloqwen3.5-ocr, essas tarefas funcionam em conjunto com seu Prompt personalizado (deixando de substituí-lo), e os resultados são retornados no campoocr_result. Modelos anteriores utilizam umPromptinterno fixo. - OpenAI-compatible SDK: Passe manualmente o
Promptespecífico da tarefa na sua mensagem.
task, um Prompt fixo, um formato de saída e um exemplo de saída:
- Reconhecimento de alta precisão
- Extração de informações
- Análise de tabelas
- Análise de documentos
- Reconhecimento de fórmulas
- Reconhecimento geral de texto
- Reconhecimento multilíngue
qwen-vl-ocr-2025-08-28 ou a versão mais recente (recomendado). Recursos:- Reconhece e extrai conteúdo textual.
- Detecta a posição do texto ao localizar linhas de texto e retornar suas coordenadas.
Para desenhar caixas delimitadoras na imagem original usando as coordenadas retornadas, consulte o FAQ .
| Valor de task | Prompt especificado | Formato de saída e exemplo |
|---|---|---|
advanced_recognition | Localiza todas as linhas de texto e retorna as coordenadas do retângulo rotacionado ([cx, cy, width, height, angle]). |
|
Exemplo de resposta
Exemplo de resposta
Análise de documentos PDF
O qwen3.5-ocr permite enviar arquivos PDF diretamente pela Response API para análise de documentos, sem necessidade de dividir manualmente o PDF em imagens. O tamanho da saída não é limitado pelo comprimento máximo de saída do modelo, o que possibilita a análise completa de documentos longos. Apenas a Response API é suportada; a Chat API não é compatível. Limites para arquivos PDF: no máximo 100 MB. O limite de páginas depende de task em ocr_options: até 50 páginas quando task é definido como document_parsing e até 10 páginas quando task não é definido ou é definido como outra tarefa.
Os exemplos a seguir utilizam a Response API para enviar arquivos PDF destinados à análise de documentos.
Para modelos anteriores (qwen-vl-ocr-2025-11-20e anteriores) que não suportam a Response API, utilize uma biblioteca de processamento de imagens, como aPythoncompdf2image, para converter cada página do PDF em uma imagem e, em seguida, aplique o método multi-image input para reconhecimento página por página.
Para mais casos de uso da OpenAI Responses API (como recuperar e gerenciar respostas concluídas do modelo), consulte OpenAI compatible - Responses .
Enviar um arquivo local (codificação Base64 ou caminho do arquivo)
Faça upload de arquivos locais usando codificação Base64 ou um caminho direto de arquivo. Selecione o método com base no tamanho do arquivo e no tipo de SDK — consulte How to select a file upload method. Ambos os métodos devem atender aos requisitos de arquivo descritos em Image limits.
- Usar codificação Base64
- Usar caminho do arquivo
Etapas para enviar uma string codificada em Base64
Etapas para enviar uma string codificada em Base64
-
Codifique o arquivo: converta a imagem local em uma string codificada em Base64.
Código de exemplo para converter uma imagem em string Base64
-
Construa uma Data URL no seguinte formato:
data:[MIME_type];base64,{base64_image}.- Substitua
MIME_typepelo tipo de mídia real. Certifique-se de que o tipo corresponda ao valorMIME Typena tabela Image limits, comoimage/jpegouimage/png. base64_imagecorresponde à string codificada em Base64 gerada na etapa anterior.
- Substitua
-
Chame o modelo: passe a
Data URLusando o parâmetroimageouimage_urlpara chamar o modelo.
- Enviar um caminho de arquivo
- Enviar uma string codificada em Base64
O envio de caminho de arquivo é suportado apenas para chamadas feitas com os SDKs DashScope Python e Java. Este método não é compatível com DashScope HTTP ou métodos compatíveis com OpenAI.
Outros casos de uso
Limitações
Limites de imagem
- Dimensões e proporção: A largura e a altura da imagem devem ser superiores a 10 pixels. A proporção não pode exceder 200:1 ou 1:200.
- Total de pixels: O modelo ajusta automaticamente a escala das imagens, portanto não há um limite rígido para o número total de pixels. No entanto, uma imagem não pode ultrapassar 15,68 milhões de pixels.
-
Formatos de imagem suportados
-
Para imagens com resolução abaixo de 4K
(3840x2160), os seguintes formatos são suportados:Formato de imagem
Extensões comuns
Tipo MIME
BMP
.bmp
image/bmp
JPEG
.jpe, .jpeg, .jpg
image/jpeg
PNG
.png
image/png
TIFF
.tif, .tiff
image/tiff
WEBP
.webp
image/webp
HEIC
.heic
image/heic
-
Para imagens com resolução entre
4K(3840x2160)e8K(7680x4320), apenas os formatos JPEG, JPG e PNG são suportados.
-
Para imagens com resolução abaixo de 4K
-
Tamanho da imagem:
- Ao fornecer uma imagem por meio de uma URL pública ou caminho local:
qwen3.5-ocraceita imagens de até20 MB; outras versões suportam até10 MB. - Se você fornecer os dados em codificação Base64, a string codificada não pode exceder
10 MB.
Consulte também: How do I compress an image or video to the required size? .
- Ao fornecer uma imagem por meio de uma URL pública ou caminho local:
Limites do modelo
-
System message: O Qwen-OCR utiliza uma
System Messageinterna fixa e não aceita mensagens personalizadas. Passe todas as instruções naUser Message. -
Conversas de múltiplas rodadas: A partir da versão
qwen3.5-ocr, conversas de múltiplas rodadas são suportadas — você pode enviar mensagens de texto subsequentes sem uma URL de imagem. As versõesqwen-vl-ocr-2025-11-20e anteriores processam apenas a mensagem mais recente e não retêm contexto. - Risco de alucinação: O modelo pode apresentar alucinações se o texto em uma imagem for muito pequeno ou tiver baixa resolução. Além disso, a precisão das respostas para perguntas não relacionadas à extração de texto não é garantida.
-
Erro ao processar arquivos de texto:
- Para arquivos que contêm dados de imagem, siga as recomendações em Going live para transformá-los em uma sequência de imagens antes do processamento.
- Para arquivos com texto simples ou dados estruturados, utilize Qwen-Long, um modelo capaz de analisar textos longos.
Tipos de certificados e documentos suportados
A tarefa de extração de informações suporta a extração de dados estruturados dos seguintes certificados, recibos e licenças.
- Passaportes e documentos de viagem: Passaporte chinês, passaporte de Macau, Permissão de Viagem para Residentes de Hong Kong e Macau no Continente, Permissão de Viagem para Residentes de Taiwan no Continente e Permissão de Retorno para Residentes de Hong Kong e Macau.
- Documentos veiculares e notas fiscais de venda: Carteira de motorista, placa do veículo, certificado de conformidade do veículo, certificado de registro do veículo, nota fiscal de venda de veículo automotor e nota fiscal de venda de veículo usado.
- Notas fiscais e recibos tributários: Nota fiscal comum de IVA (rolo), nota fiscal especial de valor fixo, nota fiscal impressa por máquina geral, certificado de pagamento de impostos e recibo de receita não tributária central.
- Recibos de transporte: Bilhete de trem de alta velocidade 12306, bilhete de trem, bilhete de barco, recibo de pedágio de via expressa e nota fiscal impressa por máquina de via expressa.
- Cartões financeiros e recibos: Cartão de crédito, letra de câmbio bancária eletrônica, recibo de pagamento e cartão de seguridade social.
- Licenças comerciais e alvarás: Licença comercial, licença de operação de alimentos, licença de produção de alimentos, licença de operação farmacêutica e licença de operação de dispositivos médicos.
- Certificado imobiliário: Certificado de propriedade imobiliária.
- Carteiras de identidade internacionais: Identidade de Hong Kong, identidade de Macau, identidade indonésia, identidade tailandesa, identidade vietnamita, identidade malaia, identidade filipina, identidade indiana, identidade turca, identidade paquistanesa, identidade mexicana, identidade do Reino Unido e identidade dos EUA.
- Passaportes e carteiras de motorista internacionais: Passaporte indiano, passaporte de Singapore, passaporte tailandês, passaporte dos EUA, passaporte australiano, passaporte dos Emirados Árabes Unidos, carteira de motorista filipina, carteira de motorista japonesa e carteira de motorista dos EUA.
Faturamento e limitação de taxa
-
Faturamento: O Qwen-OCR é um modelo multimodal. O custo total é calculado da seguinte forma: (Número de tokens de entrada × Preço unitário de entrada) + (Número de tokens de saída × Preço unitário de saída). Visualize as faturas ou recarregue sua conta no console Expenses and Costs.
-
Cálculo de tokens de imagem: Utilize o código abaixo para estimar o uso de tokens de imagem. O faturamento real baseia-se na resposta da API.
Código de exemplo para estimar tokens de imagem
Fórmula: Tokens de imagem =(h_bar * w_bar) / token_pixels + 2.-
h_bar * w_barrepresenta as dimensões da imagem redimensionada. O modelo pré-processa a imagem ajustando sua escala para um limite específico de pixels. Esse limite depende do valor do parâmetromax_pixels. -
token_pixelsrepresenta o valor de pixels porToken.- Para
qwen3.5-ocr,qwen-vl-ocr,qwen-vl-ocr-2025-11-20eqwen-vl-ocr-latest, este valor é fixo em32*32(ou seja,1024). - Para outros modelos, este valor é fixo em
28*28(ou seja,784).
- Para
-
-
Cálculo de tokens de imagem: Utilize o código abaixo para estimar o uso de tokens de imagem. O faturamento real baseia-se na resposta da API.
- Limitação de taxa: Para consultar os limites de taxa do Qwen-OCR, veja Rate limiting.
- Cota gratuita (apenas Singapore): O Qwen-OCR oferece uma cota gratuita de 1 milhão de tokens. Essa cota é válida por 90 dias, contados a partir da data de ativação do Model Studio ou da aprovação da sua solicitação para usar o modelo.
Entrada em produção
-
Pré-processamento de imagens:
-
Garanta que as imagens de entrada estejam nítidas, com iluminação uniforme e sem compressão excessiva:
- Armazene e transmita imagens em formato sem perdas (como PNG) para evitar perda de informações.
- Para melhorar a definição da imagem, utilize algoritmos de redução de ruído, como filtragem média ou mediana, para suavizar imagens ruidosas.
- Para corrigir iluminação irregular, aplique algoritmos como equalização adaptativa de histograma e ajuste o brilho e o contraste.
-
Imagens inclinadas: Defina
enable_rotate: trueno DashScope SDK para corrigir a rotação antes do reconhecimento. -
Imagens muito pequenas ou muito grandes: Use
min_pixelsemax_pixelspara controlar o dimensionamento da imagem.min_pixels: Amplia imagens pequenas para melhorar os detalhes. Mantenha o valor padrão.max_pixels: Evita que imagens excessivamente grandes consumam tokens demais. O padrão atende à maioria dos casos. Aumente esse valor quando textos pequenos não forem detectados — isso eleva o consumo de tokens.
-
Garanta que as imagens de entrada estejam nítidas, com iluminação uniforme e sem compressão excessiva:
- Validação de resultados: Os resultados de reconhecimento do modelo podem conter erros. Em operações comerciais críticas, implemente um processo de revisão manual ou adicione regras de validação para verificar a precisão da saída do modelo. Por exemplo, use validação de formato para números de carteira de identidade e cartões bancários.
- Processamento em lote: Para cargas de trabalho de alto volume e não em tempo real, utilize the Batch API para processar tarefas de forma assíncrona com custo reduzido.
Perguntas frequentes
Como escolher um método de upload de arquivo?
Como escolher um método de upload de arquivo?
Tipo | Especificações | DashScope SDK (Python, Java) | Compatível com OpenAI / DashScope HTTP |
|---|---|---|---|
Imagem | Maior que 7 MB e menor que 10 MB | Informe o caminho local | Apenas URLs públicas são suportadas. Utilize o Object Storage Service. |
Menor que 7 MB | Informe o caminho local | Codificação Base64 |
A codificação Base64 aumenta o tamanho dos dados. O arquivo original deve ter menos de 7 MB.
O uso de caminho local ou codificação Base64 ajuda a prevenir timeouts de download no servidor e melhora a estabilidade.
Como desenhar quadros de detecção na imagem original após o modelo retornar resultados de localização de texto?
Como desenhar quadros de detecção na imagem original após o modelo retornar resultados de localização de texto?
A resposta está vazia ou contém tags estilo frontend após eu passar um Prompt personalizado. O que fazer?
A resposta está vazia ou contém tags estilo frontend após eu passar um Prompt personalizado. O que fazer?
qwen3.5-ocr, se o seu Prompt personalizado contiver uma estrutura HTML completa, como <html><body>...</body></html>, o modelo pode seguir essa estrutura e retornar o resultado do OCR em formato HTML em vez de texto simples. Assim, a resposta parece vazia ou aparenta conter tags de frontend. Uma tag simples, como um único <br>, não aciona esse comportamento.Para resolver esse problema, utilize um dos métodos abaixo:- Verifique se o seu Prompt contém uma estrutura completa de tags HTML. Caso positivo, substitua-a por uma instrução em texto simples e tente novamente. Por exemplo, altere
<html><body>Extract all text from the image</body></html>paraExtract all text from the image. - Se não tiver certeza se o seu Prompt afeta o formato de saída, omita o campo
textpara utilizar o Prompt padrão do modelo. - Utilize o modelo
qwen3.7-plus. Este modelo retorna um resultado em texto simples mesmo quando você passa o mesmo Prompt contendo uma estrutura HTML.



