Model embedding multimodal mengonversi teks, gambar, dan video menjadi embedding dalam ruang semantik bersama untuk memungkinkan pengambilan lintas-modalitas (cross-modal retrieval), klasifikasi konten, dan pencarian kemiripan.
Kemampuan inti
- Pengambilan lintas-modalitas (Cross-modal retrieval): Lakukan pencarian semantik lintas jenis konten, seperti teks-ke-gambar, gambar-ke-video, atau gambar-ke-gambar.
- Kemiripan semantik: Ukur kemiripan semantik antara berbagai jenis konten dalam ruang embedding terpadu.
- Klasifikasi dan pengelompokan konten: Kelompokkan, beri label, dan klasterkan konten berdasarkan embedding semantik.
Fitur utama: Embedding untuk semua modalitas (teks, gambar, dan video) berbagi ruang semantik yang sama, memungkinkan pencocokan dan perbandingan lintas-modalitas secara langsung menggunakan metode seperti cosine similarity. Lihat embedding teks dan multimodal untuk detail pemilihan dan penggunaan model.
Jenis embedding
Model embedding multimodal mendukung dua metode untuk menghasilkan embedding:
-
Embedding multimodal independen: Menghasilkan embedding terpisah untuk setiap input, seperti teks, gambar, video, atau beberapa gambar, dalam
contents. Misalnya, input berupa satu string teks dan satu gambar menghasilkan dua embedding independen. Ini ideal untuk membandingkan item individual, seperti dalam pencarian gambar-ke-gambar atau teks-ke-gambar. -
Embedding multimodal terpadu (fused): Menggabungkan semua input dalam contents menjadi satu embedding tunggal untuk mencapai representasi semantik lintas-modalitas yang terpadu. Ini cocok untuk skenario yang memerlukan pemahaman holistik terhadap konten multimodal, seperti menggabungkan gambar produk dan deskripsi teksnya menjadi representasi terpadu untuk pengambilan. Untuk
qwen3-vl-embedding, Anda mengaktifkan fusi dengan mengaturenable_fusion=true. Embedding terpadu mendukung kombinasi berikut:- Fusi teks dan gambar
- Fusi teks dan video
- Menggabungkan beberapa gambar dengan teks (dengan meneruskan beberapa entri
image) - Fusi gambar, video, dan teks
Untuk pengenalan model, panduan pemilihan, dan instruksi penggunaan, lihat Embedding teks dan multimodal.qwen2.5-vl-embeddinghanya mendukung embedding terpadu, bukan embedding independen.tongyi-embedding-vision-plusdantongyi-embedding-vision-flashhanya mendukung embedding independen.
Ikhtisar model
- Singapura
- Tiongkok (Beijing)
Model | Dimensi embedding | Batas panjang teks | Batas ukuran gambar | Batas ukuran video | Harga (per 1 juta token input) | Kuota gratis(Catatan) |
|---|---|---|---|---|---|---|
tongyi-embedding-vision-plus | 1152 | 1.024 token | Hingga 3 MB per gambar. Mendukung hingga 8 gambar. | Hingga 10 MB per file video | Gambar/Video: $0,09 Teks: $0,09 | 1 juta token Berlaku selama 90 hari setelah mengaktifkan Model Studio |
tongyi-embedding-vision-flash | 768 | Gambar/Video: $0,03 Teks: $0,09 |
Format input dan batas penggunaan
Model multimodal terpadu | ||||
|---|---|---|---|---|
Model | Teks | Gambar | Video | Batas permintaan |
qwen3-vl-embedding | Mendukung 33 bahasa utama, termasuk Tionghoa, Inggris, Jepang, Korea, Prancis, dan Jerman. | JPEG, PNG, WEBP, BMP, TIFF, ICO, DIB, ICNS, SGI (URL atau Base64 didukung) | MP4, AVI, MOV (hanya URL) | Hingga 20 elemen konten per permintaan, dengan maksimal 5 gambar dan 1 video. |
Model multimodal independen | ||||
Model | Teks | Gambar | Video | Batas permintaan |
tongyi-embedding-vision-plus | Tionghoa dan Inggris | JPG, PNG, BMP (URL atau Base64 didukung) | MP4, MPEG, MOV, MPG, WEBM, AVI, FLV, MKV (hanya URL) | Tidak ada batas jumlah elemen konten. Jumlah total token input tidak boleh melebihi batas token pemrosesan batch. |
tongyi-embedding-vision-flash | ||||
multimodal-embedding-v1 | JPG, PNG, BMP (URL atau Base64 didukung) | Hingga 20 elemen konten per permintaan, dengan maksimal 20 segmen teks, 1 gambar, dan 1 video. | ||
Semua model menerima input teks, gambar, dan video, baik secara individual maupun kombinasi. Modeltongyi-embedding-vision-plus,tongyi-embedding-vision-flashjuga mendukungmulti_imagesuntuk urutan gambar.
Kemampuan model
Model | Dimensi default | Tipe vektor | Input yang didukung | Deskripsi |
qwen3-vl-embedding | 2560 | Independen / Terpadu | teks, gambar, video, beberapa gambar | Mode terpadu, diaktifkan dengan parameter |
tongyi-embedding-vision-plus | 1152 | Hanya independen | teks, gambar, video, multi_images | Mendukung urutan |
tongyi-embedding-vision-flash | 768 | |||
multimodal-embedding-v1 | 1024 | teks, gambar, video | Dimensi vektor tetap pada 1.024 dan tidak dapat dikonfigurasi. |
Prasyarat
Dapatkan Kunci API dan ekspor Kunci API sebagai variabel lingkungan. Jika Anda menggunakan SDK untuk melakukan panggilan, instal SDK DashScope.
Panggilan HTTP
POST https://dashscope.aliyuncs.com/api/v1/services/embeddings/multimodal-embedding/multimodal-embedding
Permintaan |
Contoh berikut menggunakan model |
Header permintaan | |
Content-Type string (Wajib)Tipe konten permintaan. Harus berupa application/json. | |
Authorization string (Wajib)Mengotentikasi permintaan dengan Kunci API Model Studio. Contoh: Bearer sk-xxxx. | |
Isi permintaan | |
model string(wajib)Nama model. Pilih model dari Ikhtisar model. | |
input object(wajib)Konten input.
Properti contents array(wajib)Item konten yang akan diproses. Setiap item adalah kamus atau string yang menentukan tipe dan nilai konten dalam format {"modality_type": "input_string_or_image/video_url"}. Tipe modalitas yang didukung adalah text, image, video, dan multi_images.Model
object (opsional)Parameter pemrosesan embedding. Untuk panggilan HTTP, Anda harus membungkus parameter ini dalam objek parameters. Untuk panggilan SDK, Anda dapat menggunakan parameter ini secara langsung.
Properti output_type string (opsional)Format representasi embedding output. Saat ini, hanya dense yang didukung.dimension integer (opsional)Dimensi embedding output. Nilai yang didukung bervariasi tergantung model:
float (opsional)Laju pengambilan sampel frame video. Nilai yang lebih kecil mengekstraksi lebih sedikit frame. Rentang valid adalah [0, 1], dan default adalah 1,0.instruct string (opsional)Deskripsi tugas kustom untuk membantu model memahami maksud kueri. Instruksi dalam bahasa Inggris direkomendasikan dan dapat meningkatkan performa sebesar 1% hingga 5%.enable_fusion bool (opsional)Menentukan apakah akan menghasilkan embedding terpadu. Parameter ini hanya didukung oleh model qwen3-vl-embedding. Ketika diatur ke true, semua konten multimodal dalam array contents digabung menjadi satu embedding. Nilai default adalah false, yang menghasilkan embedding independen untuk setiap modalitas. Embedding terpadu mendukung kombinasi seperti teks dan gambar, teks dan video, beberapa gambar dan teks (dengan meneruskan beberapa item gambar), serta campuran gambar, video, dan teks. Ini cocok untuk skenario pengambilan yang memerlukan pemahaman komprehensif terhadap konten multimodal. |
Tanggapan |
Bidang usage bervariasi tergantung model. Lihat deskripsi berikut:
|
output objectOutput tugas.
Properti embeddings arrayDaftar embedding hasil, di mana setiap objek sesuai dengan elemen input.
Properti index intIndeks hasil dalam daftar input.embedding arrayDimensi array embedding yang dihasilkan bergantung pada model dan parameter dimension.type stringTipe input untuk hasil ini. text, image, video, dan multi_images masing-masing sesuai dengan input teks, gambar, video, dan multi-gambar. Tipe khusus meliputi: fusion adalah tipe yang dikembalikan oleh model qwen3-vl-embedding dalam mode embedding terpadu; vl adalah tipe yang dikembalikan oleh model qwen3-vl-embedding dalam mode embedding independen. | |
request_id stringIdentifikasi permintaan unik untuk pelacakan dan troubleshooting. | |
code stringKode error. Hanya dikembalikan untuk permintaan yang gagal. Lihat Kode error. | |
message stringPesan error detail. Hanya dikembalikan untuk permintaan yang gagal. Lihat Kode error. | |
usage objectStatistik tentang penggunaan token.
Properti input_tokens intJumlah token dalam konten input untuk permintaan saat ini. Untuk model qwen3-vl-embedding dan qwen2.5-vl-embedding, nilai ini hanya mencakup token teks (termasuk token templat sistem) dan tidak mencakup token gambar atau video. Untuk model seri tongyi-embedding-vision-*, nilai ini mencakup jumlah total token teks, gambar, dan video.input_tokens_details objectRincian rinci penggunaan token input. Bidang ini hanya dikembalikan oleh model seri tongyi-embedding-vision-*. Tidak dikembalikan oleh model qwen3-vl-embedding, qwen2.5-vl-embedding, atau multimodal-embedding-v1.
Properti image_tokens intJumlah token untuk gambar atau video input.text_tokens intJumlah token untuk teks input.intJumlah token dalam output untuk permintaan saat ini. Bidang ini hanya dikembalikan oleh model seri tongyi-embedding-vision-*.total_tokens intJumlah total token input dan output. Bidang ini dikembalikan oleh model qwen3-vl-embedding dan seri tongyi-embedding-vision-*, tetapi tidak oleh model qwen2.5-vl-embedding atau multimodal-embedding-v1. Untuk model qwen3-vl-embedding, total_tokens = input_tokens + image_tokens.image_tokens intJumlah token untuk gambar atau video input dalam permintaan saat ini. Sistem mengambil sampel frame dari video input, dengan jumlah maksimum frame dikontrol oleh konfigurasi sistem, lalu menghitung token berdasarkan hasil pemrosesan. Bidang ini dikembalikan sebagai bidang tingkat atas hanya oleh model qwen3-vl-embedding, qwen2.5-vl-embedding, dan multimodal-embedding-v1. Untuk model seri tongyi-embedding-vision-*, jumlah token gambar disertakan dalam input_tokens_details.image_tokens.image_count intJumlah gambar dalam input untuk permintaan saat ini. Bidang ini hanya dikembalikan oleh model multimodal-embedding-v1.duration intDurasi video input dalam detik. Bidang ini hanya dikembalikan oleh model multimodal-embedding-v1. |
Penggunaan SDK
ParameterinputSDK dipetakan keinput.contentsdalam badan permintaan HTTP, tetapi strukturnya berbeda.
Contoh kode
- Embedding gambar
- Embedding video
- Embedding teks
- Embedding terpadu
- Embedding terpadu multi-gambar
- Versi snapshot 2026-03-06
- URL gambar
- Gambar lokal