Embedding-Vision adalah model embedding multimodal berbasis visi yang didukung oleh LLM, menawarkan performa luar biasa dalam domain tertentu dan efisiensi biaya tinggi di berbagai bidang—seperti e-commerce, galeri foto, keamanan, dan kendaraan otonom. Dengan dukungan untuk teks, gambar, dan video, model ini dapat diterapkan pada berbagai tugas pengambilan (retrieval), termasuk text-to-image, image-to-image, text-to-video, dan video-to-video.
Penyedia Layanan Inferensi
Penyedia layanan inferensi untuk tongyi-embedding-vision-flash adalah Alibaba Cloud Model Studio.
Kemampuan Model
| Kemampuan | Dukungan | Kemampuan | Dukungan |
|---|---|---|---|
Modalitas Input | Text Image Video | Modalitas Output | — |
Pengalaman Model | Tidak Didukung | Function Calling | Tidak Didukung |
Structured Outputs | Tidak Didukung | Web Search | Tidak Didukung |
Prefix Completion | Tidak Didukung | Context Caching | Tidak Didukung |
Batch Inference | Tidak Didukung | Fine-tuning | Tidak Didukung |
Batas Konteks
| Parameter | Nilai | Parameter | Nilai |
|---|---|---|---|
Max Input Length | — | Max Output Length | — |
Context Window | — |
Harga
Halaman ini hanya menampilkan harga asli untuk panggilan API model, tidak termasuk promosi berbatas waktu. Kunjungi Konsol Model Studio untuk penawaran promosi.
- Singapura
| Item Penagihan | Harga (USD) | Unit |
|---|---|---|
Image Input | 0,03 | Per 1 juta token |
Text Input | 0,09 | Per 1 juta token |
Batas Laju
- Singapura
| Parameter | Nilai |
|---|---|
RPM (Requests Per Minute) | 600 |
TPM (Tokens Per Minute) | 200.000 |