Um modelo de reranking reavalia a pontuação de documentos recuperados e prioriza os resultados mais relevantes. Esse processo aumenta a precisão da busca quando a etapa inicial de recuperação favorece a velocidade em detrimento da exatidão.
Quando o reranking agrega mais valor: O reranking é mais eficaz quando a recuperação inicial retorna entre 20 e mais de 100 candidatos com relevância variada. Ele traz pouco benefício se os resultados já forem precisos, como em correspondências exatas de palavras-chave. Em um fluxo de trabalho típico de RAG, um modelo de embedding recupera de 50 a 100 candidatos e, em seguida, o reranking seleciona os 5 a 10 melhores para envio a um modelo de linguagem grande.
Pré-requisitos
Obtain an API key, set it as an environment variable e install the SDK.
Reordenar documentos
Envie uma consulta e uma lista de documentos candidatos para a API. O modelo retorna os documentos ordenados por relevância.
Reranking de texto (qwen3-rerank)
- OpenAI compatible
- DashScope
Reranking multimodal (qwen3-vl-rerank)
O modelo qwen3-vl-rerank reordena textos, imagens e vídeos. A consulta pode ser um texto ou uma imagem, e os documentos podem conter qualquer combinação dessas modalidades.
O reranking multimodal está disponível apenas por meio do SDK ou da API do DashScope, não pelo endpoint compatível com OpenAI.
Python
Recursos principais
Reranking com instruções (instruct)
O parâmetro instruct define a estratégia de classificação. Escreva as instruções em inglês.
-
Recuperação para perguntas e respostas (padrão):
"Given a web search query, retrieve relevant passages that answer the query."Foca em encontrar respostas diretas. Para a consulta "How to prevent a cold?", o trecho "Washing hands frequently can prevent colds" recebe uma pontuação maior do que "A cold is a common illness", pois este último é topicalmente relevante, mas não responde à pergunta. -
Similaridade semântica:
"Retrieve semantically similar text."Prioriza a equivalência de significado e é robusto a diferenças de redação. A pergunta "How do I change my password?" corresponde a "What if I forgot my password?", o que é útil para deduplicação de FAQs.
OpenAI compatible
Retornar os N principais resultados (top_n)
Use top_n para retornar apenas os documentos com melhor classificação. Caso top_n não esteja definido, todos os documentos serão retornados em ordem de relevância. Se o valor de top_n superar a quantidade de documentos de entrada, o sistema retorna todos os documentos disponíveis.
Visão geral dos modelos
- Singapore
- Beijing
Modelo | Máximo de documentos | Máximo de tokens por documento | Máximo de tokens por solicitação | Idiomas suportados | Casos de uso |
|---|---|---|---|---|---|
qwen3-rerank | 500 | 32.768 | 120.000 | Mais de 100 idiomas | Busca semântica de texto, aplicações RAG |
- Máximo de tokens por documento: Limite de tokens para uma única consulta ou documento. Se a entrada de uma única consulta ou documento exceder esse limite, a API retornará um erro HTTP 400 e não truncará a entrada.
- Máximo de documentos: Quantidade máxima de documentos por solicitação. No modelo qwen3-vl-rerank, esse limite varia conforme o tipo de documento (texto, imagem, vídeo ou misto).
- Máximo de tokens por solicitação: Calculado como
Tokens da Consulta × Número de Documentos + Total de Tokens dos Documentos.