Os modelos de embedding multimodal convertem texto, imagens e vídeos em embeddings em um espaço semântico compartilhado para permitir recuperação entre modalidades, classificação de conteúdo e busca por similaridade.
Capacidades principais
- Recuperação entre modalidades: Execute buscas semânticas em diferentes tipos de conteúdo, como texto para imagem, imagem para vídeo ou imagem para imagem.
- Similaridade semântica: Meça a similaridade semântica entre diferentes tipos de conteúdo em um espaço de embedding unificado.
- Classificação e agrupamento de conteúdo: Agrupe, rotule e organize conteúdos com base em embeddings semânticos.
Recurso principal : Os embeddings de todas as modalidades (texto, imagens e vídeo) compartilham o mesmo espaço semântico, permitindo correspondência e comparação direta entre modalidades por métodos como similaridade de cosseno. Consulte embedding de texto e multimodal para obter detalhes sobre seleção e uso de modelos.
Tipos de embedding
O modelo de embedding multimodal oferece dois métodos para gerar embeddings:
-
Embedding multimodal independente: Gera um embedding separado para cada entrada, como texto, imagem, vídeo ou múltiplas imagens, dentro de
contents. Por exemplo, uma entrada com uma string de texto e uma imagem retorna dois embeddings independentes. Essa abordagem é ideal para comparar itens individuais, como em buscas de imagem para imagem ou texto para imagem. -
Embedding multimodal fundido: Combina todas as entradas em contents em um único embedding para obter uma representação semântica unificada entre modalidades. Indicado para cenários que exigem compreensão holística do conteúdo multimodal, como a fusão da imagem de um produto com sua descrição textual em uma representação única para recuperação. Para
qwen3-vl-embedding, ative a fusão definindoenable_fusion=true. O embedding fundido aceita as seguintes combinações:- Fusão de texto e imagem
- Fusão de texto e vídeo
- Fusão de múltiplas imagens com texto (passando várias entradas
image) - Fusão de imagens, vídeo e texto
Para apresentações de modelos, orientações de seleção e instruções de uso, consulte Embedding de texto e multimodal.qwen2.5-vl-embeddingsuporta apenas embeddings fundidos, não aceitando embeddings independentes.tongyi-embedding-vision-plusetongyi-embedding-vision-flashsuportam somente embeddings independentes.
Visão geral dos modelos
- China (Beijing)
- Singapore
Modelo | Dimensões do embedding | Limite de comprimento de texto | Limite de tamanho de imagem | Limite de tamanho de vídeo | Preço (por 1.000 tokens) | Cota gratuita(Nota) |
|---|---|---|---|---|---|---|
qwen3-vl-embedding | 2560 (padrão), 2048, 1536, 1024, 768, 512, 256 | 32.000 tokens | Até 10 MB por imagem | Até 50 MB por arquivo de vídeo | Imagem/Vídeo: CNY 0,0018 Texto: CNY 0,0007 | 1 milhão de tokens Esta cota gratuita expira 90 dias após a ativação do Model Studio. |
qwen2.5-vl-embedding | 2048, 1024 (padrão), 768, 512 | Até 5 MB por imagem | ||||
tongyi-embedding-vision-plus-2026-03-06 | 1152 (padrão), 1024, 512, 256, 128, 64 | 1.024 tokens | Recomendado: até 5 MB por imagem; máximo: 10 MB. Suporta até 64 imagens. | Até 50 MB por arquivo de vídeo A codificação do vídeo deve ser H.264 ou H.265. | CNY 0,0005 | |
tongyi-embedding-vision-flash-2026-03-06 | 768 (padrão), 512, 256, 128, 64 | CNY 0,00015 | ||||
tongyi-embedding-vision-plus | 1152 | Até 3 MB por imagem. Suporta até 8 imagens. | Até 10 MB por arquivo de vídeo | CNY 0,0005 | ||
tongyi-embedding-vision-flash | 768 | CNY 0,00015 | ||||
multimodal-embedding-v1 | 1.024 | 512 tokens | Até 3 MB por imagem | Até 10 MB por arquivo de vídeo | Imagem/Vídeo: CNY 0,0009 Texto: CNY 0,0007 |
- Singapore
- China (Beijing)
Modelo | Dimensões do embedding | Limite de comprimento de texto | Limite de tamanho de imagem | Limite de tamanho de vídeo | Preço (por 1 milhão de tokens) | Cota gratuita(Nota) |
|---|---|---|---|---|---|---|
tongyi-embedding-vision-plus | 1152 | 1.024 tokens | Até 3 MB por imagem. Suporta até 8 imagens. | Até 10 MB por arquivo de vídeo | Imagem/Vídeo: $0,09 Texto: $0,09 | 1 milhão de tokens Esta cota gratuita expira 90 dias após a ativação do Model Studio. |
tongyi-embedding-vision-flash | 768 | Imagem/Vídeo: $0,03 Texto: $0,09 |
Formatos de entrada e limites de uso
| Modelo multimodal fundido | ||||
|---|---|---|---|---|
| Modelo | Texto | Imagem | Vídeo | Limite da requisição |
| qwen3-vl-embedding | Suporta 33 idiomas principais, como chinês, inglês, japonês, coreano, francês e alemão.
Todos os idiomas suportados Chinês, japonês, coreano, indonésio, vietnamita, tailandês, inglês, francês, alemão, russo, português, espanhol, italiano, sueco, dinamarquês, tcheco, norueguês, holandês, finlandês, turco, polonês, suaíli, romeno, sérvio, grego, cazaque, uzbeque, cebuano, árabe, urdu, persa, hindi/devanágari e hebraico. | JPEG, PNG, WEBP, BMP, TIFF, ICO, DIB, ICNS e SGI (URL ou Base64 suportados) | MP4, AVI e MOV (somente URL) | O número total de elementos de conteúdo em uma única requisição não pode exceder 20. A quantidade de imagens não pode ultrapassar 5. Imagens, texto e vídeos compartilham esse limite. |
| Modelo multimodal independente | ||||
| Modelo | Texto | Imagem | Vídeo | Limite da requisição |
| tongyi-embedding-vision-plus | Chinês/Inglês | JPG, PNG e BMP (URL ou Base64 suportados) | MP4, MPEG, AVI, MOV, MPG, WEBM, FLV e MKV (somente URL) | Não há limite para o número de elementos de conteúdo. O total de tokens de entrada não deve exceder o limite de tokens. |
| tongyi-embedding-vision-flash | ||||
| multimodal-embedding-v1 | O número total de elementos de conteúdo em uma única requisição não pode exceder 20. Uma requisição pode conter no máximo 1 imagem, 1 vídeo e 20 entradas de texto. Esses itens compartilham o limite total. | |||
Todos os modelos aceitam entradas de texto, imagem e vídeo, individualmente ou combinadas. Os modelostongyi-embedding-vision-plus,tongyi-embedding-vision-flashtambém suportammulti_imagespara sequências de imagens.
Capacidades dos modelos
Modelo | Dimensão padrão | Tipo de vetor | Entradas suportadas | Descrição |
qwen3-vl-embedding | 2560 | Independente / Fundido | texto, imagem, vídeo, múltiplas imagens | O modo de fusão, ativado pelo parâmetro |
tongyi-embedding-vision-plus | 1152 | Somente independente | Suporta sequências | |
tongyi-embedding-vision-flash | 768 | |||
multimodal-embedding-v1 | 1024 | texto, imagem, vídeo | A dimensão do vetor é fixa em 1.024 e não pode ser configurada. |
Pré-requisitos
Obtenha uma chave de API e exporte a chave de API como variável de ambiente. Se você usar um SDK para fazer chamadas, instale o DashScope SDK.
Chamada HTTP
POST https://dashscope.aliyuncs.com/api/v1/services/embeddings/multimodal-embedding/multimodal-embedding
Requisição |
O exemplo abaixo usa o modelo |
Cabeçalhos da requisição | |
Content-Type string (Obrigatório)O tipo de conteúdo da requisição. Deve ser application/json. | |
Authorization string (Obrigatório)Autentica a requisição com uma chave de API do Model Studio. Exemplo: Bearer sk-xxxx. | |
Corpo da requisição | |
model string(obrigatório)Nome do modelo. Selecione um modelo na Visão geral dos modelos. | |
input object(obrigatório)Conteúdo de entrada.
Propriedades contents array(obrigatório)Itens de conteúdo a serem processados. Cada item é um dicionário ou string que especifica o tipo e o valor do conteúdo no formato {"modality_type": "input_string_or_image/video_url"}. Os tipos de modalidade suportados são text, image, video e multi_images.O modelo
object (opcional)Parâmetros de processamento de embedding. Para chamadas HTTP, envolva esses parâmetros no objeto parameters. Em chamadas via SDK, use-os diretamente.
Propriedades output_type string (opcional)Formato da representação do embedding de saída. Atualmente, apenas dense é suportado.dimension integer (opcional)Dimensão do embedding de saída. Os valores suportados variam conforme o modelo:
float (opcional)Taxa de amostragem de quadros de vídeo. Um valor menor extrai menos quadros. O intervalo válido é [0, 1], sendo o padrão 1,0.instruct string (opcional)Descrição personalizada da tarefa para ajudar o modelo a entender a intenção da consulta. Recomenda-se o uso de instruções em inglês, que podem melhorar o desempenho em 1% a 5%.enable_fusion bool (opcional)Especifique se um embedding fundido deve ser gerado. Este parâmetro é suportado apenas pelo modelo qwen3-vl-embedding. Quando definido como true, todo o conteúdo multimodal no array contents é fundido em um único embedding. O valor padrão é false, que gera um embedding independente para cada modalidade. Embeddings fundidos aceitam combinações como texto e imagem, texto e vídeo, múltiplas imagens e texto (passando vários itens de imagem) e uma mistura de imagem, vídeo e texto. Essa opção é adequada para cenários de recuperação que exigem compreensão abrangente do conteúdo multimodal. |
Resposta |
O campo usage varia conforme o modelo. Veja as descrições abaixo:
|
output objectSaída da tarefa.
Propriedades embeddings arrayLista dos embeddings resultantes, onde cada objeto corresponde a um elemento de entrada.
Propriedades index intÍndice do resultado na lista de entrada.embedding arrayA dimensão do array de embeddings gerado depende do modelo e do parâmetro dimension.type stringTipo de entrada para este resultado. text, image, video e multi_images correspondem a entradas de texto, imagem, vídeo e múltiplas imagens, respectivamente. Tipos especiais incluem: fusion é o tipo retornado pelo modelo qwen3-vl-embedding no modo de embedding fundido; vl é o tipo retornado pelo modelo qwen3-vl-embedding no modo de embedding independente. | |
request_id stringIdentificador único da requisição para rastreamento e solução de problemas. | |
code stringCódigo de erro. Retornado apenas para requisições com falha. Consulte Códigos de erro. | |
message stringMensagem de erro detalhada. Retornada apenas para requisições com falha. Consulte Códigos de erro. | |
usage objectEstatísticas sobre o uso de tokens.
Propriedades input_tokens intNúmero de tokens no conteúdo de entrada da requisição atual. Para os modelos qwen3-vl-embedding e qwen2.5-vl-embedding, este valor inclui apenas tokens de texto (incluindo tokens de modelo do sistema) e não abrange tokens de imagem ou vídeo. Nos modelos da série tongyi-embedding-vision-*, este valor representa o total de tokens de texto, imagem e vídeo.input_tokens_details objectDetalhamento dos tokens de entrada. Este campo é retornado apenas pelos modelos da série tongyi-embedding-vision-*. Não é retornado pelos modelos qwen3-vl-embedding, qwen2.5-vl-embedding ou multimodal-embedding-v1.
Propriedades image_tokens intNúmero de tokens referentes às imagens ou vídeos de entrada.text_tokens intNúmero de tokens referentes ao texto de entrada.intNúmero de tokens na saída da requisição atual. Este campo é retornado apenas pelos modelos da série tongyi-embedding-vision-*.total_tokens intTotal de tokens de entrada e saída. Este campo é retornado pelos modelos qwen3-vl-embedding e tongyi-embedding-vision-*, mas não por qwen2.5-vl-embedding ou multimodal-embedding-v1. Para o modelo qwen3-vl-embedding, total_tokens = input_tokens + image_tokens.image_tokens intNúmero de tokens das imagens ou vídeos de entrada na requisição atual. O sistema amostra quadros dos vídeos de entrada, com o número máximo controlado pela configuração do sistema, e calcula os tokens com base no resultado processado. Este campo é retornado como campo de nível superior apenas pelos modelos qwen3-vl-embedding, qwen2.5-vl-embedding e multimodal-embedding-v1. Nos modelos da série tongyi-embedding-vision-*, a contagem de tokens de imagem está incluída em input_tokens_details.image_tokens.image_count intNúmero de imagens na entrada da requisição atual. Este campo é retornado apenas pelo modelo multimodal-embedding-v1.duration intDuração do vídeo de entrada em segundos. Este campo é retornado apenas pelo modelo multimodal-embedding-v1. |
Uso do SDK
O parâmetroinputdo SDK mapeia parainput.contentsno corpo da requisição HTTP, mas suas estruturas são diferentes .
Exemplos de código
- Image embedding
- Video embedding
- Text embedding
- Fused embedding
- Multi-image fused embedding
- 2026-03-06 snapshot version
- Image URL
- Local image