Os modelos de embedding convertem dados como texto, imagens e vídeos em vetores para tarefas subsequentes, incluindo busca semântica, recomendação, clustering, classificação e detecção de anomalias.
Pré-requisitos
Obtain an API key e export the API key as an environment variable. Se você usar o OpenAI SDK ou DashScope SDK para fazer chamadas, install the SDK.
Obter embeddings
- Text embedding
- Independent multimodal vectors
- Multimodal fused vectors
- OpenAI compatible API
- DashScope
Seleção de modelo
Escolha o modelo adequado com base no tipo de dados de entrada e no caso de uso.
-
Processamento de texto simples ou código: Use
qwen3.7-text-embedding. É o modelo de maior desempenho e oferece recursos avançados, como instrução de tarefa e vetor esparso, atendendo à maioria dos casos de uso de processamento de texto. -
Processamento de conteúdo multimodal:
- Embedding fundido: Para representar entradas de modalidade única ou mista como um embedding fundido em casos de uso como recuperação entre modalidades e busca de imagens, use
qwen3-vl-embedding. Por exemplo, insira uma imagem de uma camisa com o texto "encontre um estilo semelhante que pareça mais jovem", e o modelo fundirá a imagem e a instrução da tarefa em um único embedding para processamento. - Embedding independente: Para gerar um embedding independente para cada parte da entrada (como uma imagem e sua legenda correspondente), use
tongyi-embedding-vision-plus,tongyi-embedding-vision-flashou o modelo multimodal de uso geralmultimodal-embedding-v1.
- Embedding fundido: Para representar entradas de modalidade única ou mista como um embedding fundido em casos de uso como recuperação entre modalidades e busca de imagens, use
-
Processamento de dados em grande escala: Para processar grandes volumes de dados de texto não em tempo real, use
qwen3.7-text-embeddingoutext-embedding-v4com a OpenAI compatible batch API para reduzir custos significativamente.
Text embedding
- Beijing
- Hong Kong
- Singapore
| Nome do modelo | Dimensões do embedding | Tamanho do lote | Máximo de tokens por lote (Note) | Preço / 1M tokens | Idioma |
|---|---|---|---|---|---|
text-embedding-v4Parte da série Qwen3-Embedding | 2.048, 1.536, 1.024 (padrão), 768, 512, 256, 128, 64 | 10 | 8.192 | $0,072 | Mais de 100 idiomas principais, incluindo chinês, inglês, espanhol, francês, português, indonésio, japonês, coreano, alemão, russo e várias linguagens de programação |
- Entrada de array de strings: O array pode conter até 10 elementos.
- Entrada de arquivo: O arquivo de texto pode conter até 10 linhas.
Multimodal embedding
Este modelo gera embeddings a partir de entradas de texto, imagem ou vídeo. Use esses embeddings para tarefas como classificação de vídeo e imagem, recuperação de imagem-texto e busca de texto para imagem ou texto para vídeo.
A API aceita entradas únicas de texto, imagem ou vídeo, além de combinações como texto e imagens. Alguns modelos suportam múltiplas entradas do mesmo tipo, como várias imagens. Para detalhes, consulte as limitações de cada modelo.
- Singapore
- China (Beijing)
Modelo | Dimensões do embedding | Limite de comprimento de texto | Limite de tamanho de imagem | Limite de tamanho de vídeo | Preço (por 1M tokens) | Cota gratuita(Note) |
|---|---|---|---|---|---|---|
tongyi-embedding-vision-plus | 1152 | 1.024 tokens | Até 3 MB por imagem. Suporta até 8 imagens. | Até 10 MB por arquivo de vídeo | Imagem/Vídeo: $0,09 Texto: $0,09 | 1 milhão de tokens Esta cota gratuita é válida por 90 dias a partir da ativação do Model Studio, do lançamento do modelo ou da aprovação da solicitação, o que ocorrer por último. |
tongyi-embedding-vision-flash | 768 | Imagem/Vídeo: $0,03 Texto: $0,09 |
Restrições de entrada e idioma
| Modelo multimodal fundido | ||||
|---|---|---|---|---|
| Modelo | Texto | Imagem | Vídeo | Limite de requisição |
| qwen3-vl-embedding | Suporta 33 idiomas principais, como chinês, inglês, japonês, coreano, francês e alemão.
Todos os idiomas suportados Chinês, Japonês, Coreano, Indonésio, Vietnamita, Tailandês, Inglês, Francês, Alemão, Russo, Português, Espanhol, Italiano, Sueco, Dinamarquês, Tcheco, Norueguês, Holandês, Finlandês, Turco, Polonês, Suaíli, Romeno, Sérvio, Grego, Cazaque, Uzbeque, Cebuano, Árabe, Urdu, Persa, Hindi/Devanagari e Hebraico. | JPEG, PNG, WEBP, BMP, TIFF, ICO, DIB, ICNS e SGI (URL ou Base64 suportado) | MP4, AVI e MOV (apenas URL) | O total de elementos de conteúdo em uma única requisição não pode exceder 20. O número de imagens não pode exceder 5. Imagens, texto e vídeos compartilham esse limite. |
| Modelo multimodal independente | ||||
| Modelo | Texto | Imagem | Vídeo | Limite de requisição |
| tongyi-embedding-vision-plus | Chinês/Inglês | JPG, PNG e BMP (URL ou Base64 suportado) | MP4, MPEG, AVI, MOV, MPG, WEBM, FLV e MKV (apenas URL) | Sem limite no número de elementos de conteúdo. O total de tokens de entrada não deve exceder o limite de tokens. |
| tongyi-embedding-vision-flash | ||||
| multimodal-embedding-v1 | O total de elementos de conteúdo em uma única requisição não pode exceder 20. Uma requisição pode conter no máximo 1 imagem, 1 vídeo e 20 entradas de texto. Esses itens compartilham o limite total. | |||
Recursos principais
Personalizar dimensões de vetor
Os modelos qwen3.7-text-embedding, text-embedding-v4, text-embedding-v3, tongyi-embedding-vision-plus, tongyi-embedding-vision-flash, qwen3-vl-embedding aceitam dimensões de vetor personalizadas. Dimensões maiores preservam mais informações semânticas, mas aumentam os custos de armazenamento e computação.
- Casos de uso geral (Recomendado): A dimensão 1024 oferece equilíbrio ideal entre desempenho e custo, adequada para a maioria das tarefas de busca semântica.
- Cenários de alta precisão: Para aplicações que exigem alta precisão, selecione a dimensão 1536 ou 2048. Isso melhora a precisão, mas aumenta significativamente a sobrecarga de armazenamento e computação.
- Ambientes com recursos limitados: Em cenários sensíveis a custos, selecione a dimensão 768 ou inferior. Isso reduz significativamente o consumo de recursos, embora haja perda de algumas informações semânticas.
Texto de consulta vs. documento (text_type)
Este parâmetro está disponível apenas no DashScope SDK e na API.Para obter resultados ideais em tarefas de busca, vetorize o conteúdo de forma diferente conforme sua função. O parâmetro
text_type atende a essa finalidade:
- text_type: 'query': Use para texto de consulta fornecido pelo usuário. O modelo gera um vetor "semelhante a título", mais direcional e otimizado para recuperação de informações.
- text_type: 'document' (padrão): Use para o texto do documento armazenado em sua base de conhecimento. O modelo gera um vetor "semelhante a corpo", com informações mais abrangentes e otimizado para correspondência.
query e document. No entanto, para tarefas como clustering ou classificação, em que todos os textos têm a mesma função, não é necessário definir esse parâmetro.
Instruções de tarefa (instruct)
Este parâmetro está disponível apenas no DashScope SDK e na API.Forneça uma instrução de tarefa clara em inglês para orientar os modelos
qwen3.7-text-embedding e text-embedding-v4 a otimizar a qualidade do vetor para cenários específicos de recuperação, melhorando a precisão. O qwen3.7-text-embedding aprimora a capacidade de seguir instruções em 16,4% em relação ao text-embedding-v4, portanto, recomendamos seu uso prioritário. Ao usar este recurso, defina o parâmetro text_type como query.
Vetores densos e esparsos
Este parâmetro está disponível apenas no DashScope SDK e na API.Os modelos
qwen3.7-text-embedding, text-embedding-v4 e text-embedding-v3 oferecem três tipos de saída de vetor para atender a diferentes estratégias de recuperação. O embedding esparso do qwen3.7-text-embedding adota uma nova estratégia de treinamento semelhante ao SPLADE, que melhora a eficácia em 8,4% e adiciona suporte à recuperação entre idiomas.
Tipo de vetor (output_type) | Vantagens | Limitações | Casos de uso |
|---|---|---|---|
dense | Compreensão semântica profunda que identifica sinônimos e contexto para resultados mais relevantes. | Maior custo de computação e armazenamento. Não garante correspondência exata para palavras-chave. | Busca semântica, Q&A com IA, recomendação de conteúdo. |
sparse | Alta eficiência computacional, focando na correspondência exata de palavras-chave e permitindo filtragem rápida. | Falta compreensão semântica e não processa sinônimos ou contexto. | Recuperação de logs, busca de SKU de produtos, filtragem precisa de informações. |
dense&sparse | Combina correspondência semântica e de palavras-chave para resultados de busca ideais. O custo de geração permanece inalterado, e a sobrecarga da chamada de API é idêntica à do modo de vetor único. | Exige mais armazenamento, e a arquitetura do sistema e a lógica de recuperação tornam-se mais complexas. | Mecanismo de busca híbrida de alta qualidade para produção. |
Casos de uso
O código a seguir serve apenas para demonstração. Em produção, pré-compute e armazene embeddings em um banco de dados vetorial. Assim, basta gerar o embedding da consulta para recuperação.
Busca semântica
Realize correspondência semântica precisa calculando a similaridade entre o embedding da consulta e os embeddings dos documentos.
Sistema de recomendação
Analise os embeddings do histórico comportamental de um usuário para identificar seus interesses e recomendar itens semelhantes.
Clustering de texto
Agrupe textos semelhantes analisando as distâncias entre seus embeddings.
Classificação de texto
Realize classificação de texto zero-shot calculando a similaridade entre o embedding de um texto de entrada e embeddings de rótulos predefinidos. Esse processo classifica o texto em novas categorias sem exigir exemplos pré-rotulados.
Detecção de anomalias
Identifique dados anômalos calculando a similaridade entre o embedding de um texto e o embedding central de amostras normais. Dados que se desviam significativamente desse padrão são considerados anomalias.
O threshold no exemplo serve apenas para demonstração. O valor ideal varia conforme o conteúdo e a distribuição dos dados; portanto, calibre-o usando seu próprio conjunto de dados.
Referência da API
- Embedding de texto geral
- Embedding multimodal Multimodal embedding API
Códigos de erro
Se a chamada do modelo falhar e retornar uma mensagem de erro, consulte Error codes para resolução.
Limitação de taxa
Para as condições de limitação de taxa do modelo, consulte Rate limiting.
Desempenho do modelo (MTEB/CMTEB)
Benchmarks de avaliação
- MTEB (Massive Text Embedding Benchmark): Benchmark abrangente que avalia o desempenho de uso geral de embeddings de texto em tarefas como classificação, clustering e recuperação.
- CMTEB (Chinese Massive Text Embedding Benchmark): Benchmark em grande escala específico para avaliar embeddings de texto em chinês.
- As pontuações variam de 0 a 100. Pontuações mais altas indicam melhor desempenho.
Modelo | MTEB | MTEB (tarefa de recuperação) | CMTEB | CMTEB (tarefa de recuperação) |
|---|---|---|---|---|
text-embedding-v3 (512 dimensões) | 62,11 | 54,30 | 66,81 | 71,88 |
text-embedding-v3 (768 dimensões) | 62,43 | 54,74 | 67,90 | 72,29 |
text-embedding-v3 (1024 dimensões) | 63,39 | 55,41 | 68,92 | 73,23 |
text-embedding-v4 (512 dimensões) | 64,73 | 56,34 | 68,79 | 73,33 |
text-embedding-v4 (1024 dimensões) | 68,36 | 59,30 | 70,14 | 73,98 |
text-embedding-v4 (2048 dimensões) | 71,58 | 61,97 | 71,99 | 75,01 |