Permintaan inferensi untuk model besar sering kali berisi input yang tumpang tindih, seperti dalam percakapan multi-putaran atau rangkaian pertanyaan tentang buku yang sama. Context Cache mengurangi komputasi berulang dengan menyimpan awalan umum dari permintaan tersebut di cache, sehingga meningkatkan kecepatan respons dan menurunkan biaya penggunaan tanpa memengaruhi kualitas respons.
- Explicit cache: Mode yang diaktifkan secara manual. Anda membuat cache untuk konten tertentu guna memastikan hit yang deterministik selama periode validitas 5 menit. Token yang digunakan untuk membuat cache biasanya dikenai biaya sebesar 125% dari harga standar token input, sedangkan hit cache berikutnya biasanya hanya dikenai biaya sebesar 10% dari harga tersebut. Untuk informasi harga spesifik, lihat Billing.
- Implicit cache: Mode otomatis ini tidak memerlukan konfigurasi tambahan dan tidak dapat dinonaktifkan, ideal untuk skenario yang mengutamakan kenyamanan. Sistem secara otomatis mengidentifikasi dan menyimpan awalan umum dari permintaan di cache, tetapi probabilitas hit tidak dijamin. Bagian input yang dilayani dari cache biasanya dikenai biaya sebesar 20% dari harga standar token input. Untuk informasi harga spesifik, lihat Billing.
Item | Explicit cache | Implicit cache |
|---|---|---|
Dampak terhadap kualitas respons | Tidak ada | Tidak ada |
Biaya token pembuatan cache | Biasanya 125% dari harga standar token input | 100% dari harga standar token input |
Biaya token input yang di-cache | Biasanya 10% dari harga standar token input (lihat Billing) | Biasanya 20% dari harga standar token input (lihat Billing) |
Token minimum untuk caching | 1024 | 256 |
Periode validitas cache | 5 menit (diatur ulang saat terjadi hit) | Tidak pasti. Sistem secara berkala membersihkan data cache lama yang tidak digunakan. |
Explicit cache
Berbeda dengan implicit cache, explicit cache memerlukan pembuatan eksplisit dan menimbulkan overhead, tetapi memberikan rasio hit cache yang lebih tinggi serta latensi akses yang lebih rendah.
Cara kerja
Tambahkan penanda "cache_control": {"type": "ephemeral"} ke array messages. Sistem kemudian mencari mundur dari setiap penanda cache_control dan memeriksa hingga 20 blok content sebelumnya untuk menemukan cache hit.
Satu permintaan mendukung hingga empat penanda cache.
-
Cache miss
Jika terjadi cache miss, sistem membuat blok cache baru dari konten antara awal array messages dan penanda
cache_control. Blok cache baru memiliki periode validitas 5 menit.Sistem membuat cache setelah model menghasilkan respons. Tunggu hingga permintaan pembuatan selesai sebelum mencoba mengakses cache tersebut.
Blok cache berisi minimal 1.024 token.
- Cache hit Jika terjadi cache hit, sistem memilih awalan yang paling panjang sesuai dan mengatur ulang periode validitas blok cache yang sesuai menjadi 5 menit.
- Kirim permintaan pertama: Kirim pesan sistem berisi teks A (lebih dari 1.024 token), dan tambahkan penanda cache:
- Jika terdapat 20 atau kurang "Other messages," permintaan akan mengenai blok cache A dan mengatur ulang periode validitasnya menjadi 5 menit. Sistem juga membuat blok cache baru berdasarkan A, pesan lainnya, dan B.
- Jika terdapat lebih dari 20 "Other messages," permintaan tidak mengenai blok cache A. Sistem tetap membuat blok cache baru berdasarkan konteks lengkap (A, pesan lainnya, dan B).
Model yang didukung
- Singapore
- China (Beijing)
- Jerman (Frankfurt)
- Hong Kong (China)
- Jepang (Tokyo)
- AS (Virginia)
Model berikut tersedia dalam cakupan penerapan Internasional.Qwen Max: qwen3.8-max, qwen3.7-max, qwen3.7-max-2026-05-20, qwen3.7-max-2026-06-08, qwen3.6-max-preview, qwen3-maxQwen Open-source: qwen3.8-2.4t-a95b, qwen3.8-27bQwen Plus: qwen3.7-plus, qwen3.7-plus-2026-05-26, qwen3.6-plus, qwen3.5-plus, qwen3.5-plus-2026-04-20, qwen-plusQwen Flash: qwen3.8-flash, qwen3.7-flash, qwen3.7-flash-2026-07-15, qwen3.6-flash, qwen3.5-flash, qwen-flashQwen Coder: qwen3-coder-plus, qwen3-coder-flashQwen VL: qwen3-vl-plus, qwen3-vl-flashDeepSeek: deepseek-v3.2
Memulai cepat
Contoh berikut menunjukkan mekanisme pembuatan blok cache dan cache hit untuk protokol yang kompatibel dengan OpenAI, DashScope, dan Anthropic.
- Kompatibel dengan OpenAI
- DashScope
- Kompatibel dengan Anthropic
cache_control mengaktifkan explicit cache untuk konten repositori kode tiruan. Untuk permintaan berikutnya yang menanyakan konten ini, sistem menggunakan kembali blok cache, sehingga menghilangkan komputasi ulang. Hal ini membuat permintaan yang mengenai cache lebih cepat dan lebih murah dibandingkan permintaan awal yang membuat cache.
Kontrol detail halus dengan beberapa penanda cache
Dalam skenario kompleks, prompt sering terdiri dari beberapa bagian dengan frekuensi penggunaan ulang yang berbeda. Anda dapat menggunakan beberapa penanda cache untuk mencapai kontrol detail halus.
Sebagai contoh, prompt untuk agen layanan pelanggan cerdas biasanya mencakup:
- Persona sistem: Sangat stabil dan jarang berubah.
- Pengetahuan eksternal: Diperoleh dari basis pengetahuan atau melalui kueri tool dan mungkin tidak berubah selama satu percakapan.
- Riwayat percakapan: Berkembang secara dinamis.
- Pertanyaan saat ini: Berbeda untuk setiap permintaan.
Billing
Explicit cache hanya memengaruhi cara token input ditagih. Aturannya adalah sebagai berikut:
-
Pembuatan cache: Konten yang digunakan untuk membuat cache baru ditagih sebesar 125% dari harga standar token input. Jika konten untuk cache baru mencakup cache yang sudah ada sebagai awalan, hanya bagian tambahannya yang ditagih untuk pembuatan cache (yaitu, jumlah token cache baru dikurangi jumlah token cache yang sudah ada).
Sebagai contoh, jika Anda memiliki cache yang sudah ada sebesar 1.200 token (Cache A) dan Anda menggunakan permintaan baru untuk menyimpan cache 1.500 token konten (Konten AB), 1.200 token pertama ditagih sebagai cache hit sebesar 10% dari harga standar. 300 token baru ditagih untuk pembuatan cache sebesar 125% dari harga standar.
Parameter
cache_creation_input_tokensmenentukan jumlah token yang digunakan untuk pembuatan cache. -
Cache hit: Ditagih sebesar 10% dari harga standar token input.
Parameter
cached_tokensmenentukan jumlah token yang di-cache. - Token lainnya: Token yang bukan merupakan cache hit maupun digunakan untuk pembuatan cache ditagih dengan harga standar token input.
- Pengecualian: Harga cache hit eksplisit untuk qwen3.8-max, qwen3.8-flash, dan qwen3.8-2.4t-a95b bukan 10% dari harga standar token input. Untuk informasi harga spesifik, lihat konsol Model Studio. (Harga pembuatan cache tetap 125% dari harga standar.)
Konten yang dapat di-cache
Hanya jenis pesan berikut dalam array messages yang mendukung penambahan penanda cache:
-
Pesan sistem
Untuk pemanggilan fungsi, jika permintaan mencakup parameter
tools, definisi tool dimasukkan dalam pesan sistem untuk perhitungan cache. Definisi tool tidak dapat di-cache secara independen. Penanda cache yang ditambahkan ke definisi tool diabaikan, karena hanya dapat ditambahkan ke konten pesan. -
Pesan pengguna
Saat membuat cache dengan model
qwen3-vl-plus, Anda dapat menempatkan penandacache_controlsetelah konten multimodal atau teks. Posisinya tidak memengaruhi cara seluruh pesan pengguna di-cache. - Pesan asisten
- Pesan tool (hasil eksekusi tool)
content menjadi array dan menambahkan bidang cache_control:
messages.
Batasan cache
- Panjang prompt minimum yang dapat di-cache adalah 1.024 token.
-
Cache menggunakan strategi pencocokan awalan mundur. Cache miss terjadi jika konten yang cocok dan pesan dengan penanda
cache_controldipisahkan oleh lebih dari 20 blok konten. -
typehanya dapat diatur keephemeral, yang membuat cache dengan periode validitas 5 menit. -
Satu permintaan mendukung hingga empat penanda cache.
Jika lebih dari empat penanda cache disediakan, hanya empat penanda terakhir yang berlaku.
Optimasi cache untuk Function Calling
Definisi tool diserialisasi menjadi string JSON untuk caching. Untuk mencegah invalidasi cache, definisi ini harus identik di semua permintaan. Perhatikan hal berikut:
- Urutan tool konsisten: Urutan tool dalam array
toolsharus konsisten di semua permintaan. - Urutan bidang konsisten: Urutan bidang JSON dalam tool yang sama harus konsisten di semua permintaan.
- Struktur bidang konsisten: Jangan menghilangkan atau menambahkan bidang, meskipun kosong atau opsional.
Mengoptimalkan struktur pesan untuk pemanggilan tool paralel
Saat Anda menggunakan pemanggilan tool paralel, model mengembalikan beberapa tool_calls dalam satu respons. Jika Anda mengirim setiap hasil tool sebagai pesan tool terpisah, jumlah blok konten dalam array messages meningkat pesat. Ketika lebih dari 20 blok konten memisahkan penanda cache_control dari konten sebelumnya, jendela pencarian mundur tidak dapat mencapai blok-blok tersebut, menyebabkan cache miss.
Untuk mengatasi hal ini, gabungkan pesan tool berurutan dengan peran yang sama menjadi satu pesan tool dengan beberapa blok konten sebelum mengirim permintaan berikutnya. Hal ini mengurangi jumlah total blok konten dan menjaga konten yang ingin Anda cache tetap berada dalam jendela pencarian mundur 20 blok.
Sebelum optimasi (pesan tool terpisah — tingkat hit cache lebih rendah):
cache_control pada posisi stabil dalam array messages (misalnya, pada pesan sistem atau konten lain yang jarang berubah). Satu permintaan mendukung hingga empat penanda cache.
Contoh penggunaan
Menanyakan teks panjang
Menanyakan teks panjang
Untuk memastikan kinerja model, sistem menambahkan beberapa token internal. Token ini ditagih dengan harga input standar. Untuk informasi lebih lanjut, lihat FAQ.
Alat Caching untuk Pemanggilan Fungsi
Alat Caching untuk Pemanggilan Fungsi
tools di-cache sebagai bagian dari pesan sistem. Pastikan definisi tool identik untuk setiap permintaan (termasuk urutan tool, urutan bidang, dan struktur bidang), dan tambahkan penanda cache_control pada content terakhir dalam messages.Berikut ini alur lengkapnya: permintaan pertama membuat cache, dan permintaan kedua mengenai cache.Percakapan multi-putaran berkelanjutan
Percakapan multi-putaran berkelanjutan
Implicit cache
Model yang didukung
- China (Beijing)
- Singapore
- AS (Virginia)
- Jerman (Frankfurt)
- China (Hong Kong)
- Jepang (Tokyo)
-
Model generasi teks
- Qwen Max: qwen3.8-max, qwen3.7-max, qwen3.7-max-2026-05-20, qwen3.7-max-2026-06-08, qwen3-max, qwen3-max-preview, qwen-max
- Qwen Plus: qwen3.7-plus, qwen3.7-plus-2026-05-26, qwen-plus
- Qwen Flash: qwen3.8-flash, qwen3.7-flash, qwen3.7-flash-2026-07-15, qwen-flash
- Qwen Turbo: qwen-turbo
- Qwen Coder: qwen3-coder-plus, qwen3-coder-flash
- Qwen Open-source: qwen3.8-2.4t-a95b, qwen3.8-27b
- DeepSeek: deepseek-v4-pro, deepseek-v4-flash, deepseek-v3.2, deepseek-v3.1, deepseek-v3, deepseek-r1
- Kimi: kimi-k3, kimi-k2.7-code, kimi-k2.6, kimi-k2.5, kimi-k2-thinking, Moonshot-Kimi-K2-Instruct
- GLM: glm-5.2, glm-5.2-fast-preview, glm-5.1, glm-5, glm-4.7, glm-4.6
- MiniMax: MiniMax-M2.5
-
Model pemahaman visual
- Qwen VL: qwen3-vl-plus, qwen3-vl-flash, qwen-vl-max, qwen-vl-plus
Cara kerja
Fitur implicit cache diaktifkan secara otomatis saat permintaan dikirim ke model yang didukung. Sistem bekerja sebagai berikut:
-
Pencarian: Setelah menerima permintaan, sistem menggunakan pencocokan awalan untuk memeriksa cache guna mencari awalan umum dari konten dalam array
messagespermintaan. -
Keputusan:
- Jika terjadi cache hit, sistem menggunakan hasil yang di-cache untuk sisa inferensi.
- Jika terjadi cache miss, sistem memproses permintaan secara normal dan menyimpan awalan prompt di cache untuk permintaan mendatang.
Sistem secara berkala membersihkan data cache yang telah lama tidak digunakan. Probabilitas hit Context Cache tidak 100%. Cache miss dapat terjadi meskipun konteks permintaan identik. Sistem menentukan probabilitas hit spesifik.
Meningkatkan probabilitas cache hit
Cache hit implicit terjadi ketika awalan dari permintaan berbeda memiliki konten duplikat. Untuk meningkatkan probabilitas hit, tempatkan konten duplikat di awal prompt dan konten unik di akhir.
- Model teks: Sebagai contoh, asumsikan sistem telah menyimpan cache "ABCD". Permintaan untuk "ABE" mungkin mengenai bagian "AB", tetapi permintaan untuk "BCD" tidak akan mengenai.
-
Model pemahaman visual:
- Untuk mengajukan beberapa pertanyaan tentang gambar atau video yang sama, tempatkan gambar atau video sebelum teks.
- Untuk mengajukan pertanyaan yang sama tentang gambar atau video berbeda, tempatkan teks sebelum gambar atau video.
Billing
Tidak ada biaya tambahan yang dikenakan untuk mengaktifkan mode implicit cache.
Saat permintaan mengenai cache, token input dari cache hit ditagih sebagai cached_token. Tingkat diskon untuk token ini bervariasi berdasarkan model. Token input yang tidak mengenai cache ditagih sebagai input_token standar. Token output ditagih dengan harga aslinya.
-
Untuk model selain deepseek-v4-pro, qwen3.8-max, qwen3.8-flash, dan qwen3.8-2.4t-a95b: Harga satuan
cached_tokenadalah 20% dari harga satuaninput_token. -
deepseek-v4-pro: Harga satuan
cached_tokenbukan 20% dari harga satuaninput_token. Untuk informasi harga spesifik, lihat konsol Model Studio. -
qwen3.8-max, qwen3.8-flash, dan qwen3.8-2.4t-a95b: Harga satuan
cached_tokenbukan 20% dari harga satuaninput_token. Untuk informasi harga spesifik, lihat konsol Model Studio. - GLM (diterapkan di Alibaba Cloud Model Studio): 25% untuk glm-5.2 dan glm-5.2-fast-preview, dan 20% untuk semua model seri GLM lainnya.
- Token yang tidak mengenai cache (5.000): Ditagih 100% dari harga satuan.
- Token yang mengenai cache (5.000): Ditagih 20% dari harga satuan.

cached_tokens dalam respons.
Panggilan yang dilakukan menggunakan metode OpenAI-compatible - Batch (input file) tidak memenuhi syarat untuk diskon cache.
Contoh cache hit
- Model generasi teks
- Model pemahaman visual
- Kompatibel dengan OpenAI
- DashScope
- Kompatibel dengan Anthropic
usage.prompt_tokens_details.cached_tokens. Nilai ini merupakan bagian dari usage.prompt_tokens.Kasus penggunaan
Jika permintaan Anda memiliki awalan umum, context cache dapat secara signifikan meningkatkan kecepatan inferensi, menurunkan biaya inferensi, dan mengurangi latensi paket pertama. Fitur ini sangat berguna dalam kasus penggunaan berikut:
- Menjawab pertanyaan teks panjang Gunakan pola ini saat Anda mengirim beberapa permintaan tentang teks panjang yang sama, seperti novel, buku teks, atau dokumen hukum. Pesan permintaan pertama
video sebelum teks meningkatkan probabilitas cache hit. Jika Anda mengajukan pertanyaan yang sama tentang video berbeda, menempatkan teks sebelum video meningkatkan probabilitas cache hit. Contoh berikut menunjukkan dua permintaan untuk video yang sama:
FAQ
T: Berapa lama context cache disimpan (periode validitas)?
J: Periode validitas context cache tergantung pada jenis cache:
- Explicit cache: Periode validitas adalah 5 menit, dan setiap cache hit mengatur ulangnya menjadi 5 menit lagi. Jika blok cache tidak mengenai dalam 5 menit, sistem secara otomatis membersihkannya.
- Implicit cache: Dikelola secara otomatis oleh sistem tanpa periode validitas tetap. Sistem secara berkala membersihkan data cache yang telah lama tidak digunakan.
T: Bagaimana cara menonaktifkan implicit cache?
J: Anda tidak dapat menonaktifkannya. Implicit cache diaktifkan untuk semua permintaan model yang berlaku karena tidak memengaruhi kualitas respons. Saat terjadi cache hit, biaya berkurang dan kecepatan respons meningkat.
T: Mengapa cache miss eksplisit terjadi?
J: Cache miss dapat terjadi karena alasan berikut:
- Sistem membersihkan blok cache jika tidak mengenai dalam periode validitas 5 menit.
- Jika interval antara
contentterakhir dan blok cache yang sudah ada lebih dari 20 blokcontent, cache hit tidak akan terjadi. Kami menyarankan Anda membuat blok cache baru.
T: Apakah cache hit mengatur ulang validitasnya?
J: Ya. Setiap hit mengatur ulang periode validitas blok cache menjadi 5 menit.
T: Apakah explicit cache dibagikan antar akun?
J: Tidak. Data implicit cache dan explicit cache diisolasi pada tingkat akun.
T:Apakah explicit cache dibagikan lintas model?
J: Tidak. Data cache diisolasi antar model.
T: Mengapainput_tokensdalamusagetidak sama dengan jumlahcache_creation_input_tokensdancached_tokens?
J: Untuk memastikan kualitas output model, layanan backend menambahkan sejumlah kecil token (biasanya 10 atau kurang) ke prompt Anda. Token ini ditempatkan setelah penanda cache_control, sehingga tidak dihitung untuk pembuatan atau pembacaan cache, tetapi termasuk dalam total input_tokens.