Model reranking memberi skor ulang dokumen yang telah diambil dan memprioritaskan hasil yang paling relevan, sehingga meningkatkan presisi pencarian ketika pengambilan awal mengutamakan kecepatan daripada akurasi.
Kapan reranking memberikan nilai tambah paling besar: Reranking bekerja paling optimal ketika pengambilan awal mengembalikan 20–100+ kandidat dengan tingkat relevansi yang bervariasi, dan memberikan manfaat terbatas jika hasilnya sudah sangat tepat (misalnya, pencocokan kata kunci eksak). Alur kerja RAG umumnya mengambil 50–100 kandidat menggunakan model penyematan (embedding), lalu melakukan reranking untuk memilih 5–10 hasil teratas bagi model bahasa besar.
Prasyarat
Dapatkan Kunci API, tetapkan sebagai Variabel lingkungan, dan instal SDK.
Rerank dokumen
Kirimkan kueri dan daftar dokumen kandidat ke API. Model akan mengembalikan dokumen yang telah diurutkan berdasarkan relevansinya.
Text reranking (qwen3-rerank)
- Kompatibel dengan OpenAI
- DashScope
Multimodal reranking (qwen3-vl-rerank)
Model qwen3-vl-rerank melakukan reranking terhadap teks, gambar, dan video. Kueri dapat berupa teks atau gambar, dan dokumen dapat berisi kombinasi modalitas tersebut.
Reranking multimodal hanya tersedia melalui SDK atau API DashScope, bukan melalui titik akhir yang kompatibel dengan OpenAI.
Python
Fitur utama
Reranking dengan instruksi (instruct)
Parameter instruct menetapkan strategi peringkat. Tulis instruksi dalam bahasa Inggris.
-
Pengambilan jawaban pertanyaan (default):
"Given a web search query, retrieve relevant passages that answer the query."Berfokus pada pencarian jawaban. Untuk kueri "How to prevent a cold?", kalimat "Washing hands frequently can prevent colds" mendapat skor lebih tinggi dibandingkan "A cold is a common illness," yang memang relevan secara topik tetapi bukan jawaban langsung. -
Kesamaan semantik:
"Retrieve semantically similar text."Berfokus pada kesetaraan semantik, tahan terhadap perbedaan redaksi. "How do I change my password?" cocok dengan "What if I forgot my password?" — berguna untuk deduplikasi FAQ.
Kompatibel dengan OpenAI
Kembalikan N hasil teratas (top_n)
Gunakan top_n untuk hanya mengembalikan dokumen dengan peringkat tertinggi. Jika top_n tidak ditentukan, semua dokumen akan dikembalikan dalam urutan berdasarkan relevansinya. Jika top_n melebihi jumlah dokumen input, semua dokumen akan dikembalikan.
Ikhtisar model
- Singapura
- Beijing
Model | Dokumen maksimum | Token maksimum per dokumen | Token maksimum per permintaan | Bahasa yang didukung | Kasus penggunaan |
|---|---|---|---|---|---|
qwen3-rerank | 500 | 32.768 | 120.000 | Lebih dari 100 bahasa | Pencarian teks semantik, aplikasi RAG |
- Token maksimum per dokumen: Jumlah token maksimum untuk satu kueri atau dokumen. Jika input satu kueri atau dokumen melebihi batas ini, API akan mengembalikan error HTTP 400 dan tidak memotong input.
- Dokumen maksimum: Jumlah dokumen maksimum per permintaan. Untuk qwen3-vl-rerank, batas ini berbeda-beda tergantung jenis dokumen (teks, gambar, video, atau campuran).
- Token maksimum per permintaan: Dihitung sebagai
Token Kueri × Jumlah Dokumen + Total Token Dokumen.