Topik ini menjelaskan cara menggunakan explicit cache beserta praktik terbaiknya. Dengan menambahkan penanda cache ke permintaan Anda, explicit cache menjamin hit cache yang deterministik untuk konten input yang identik, sehingga secara signifikan mengurangi biaya dan latensi.
Kapan menggunakan explicit cache
- Anda memerlukan hit cache yang dijamin: Explicit cache memberikan hit cache 100% deterministik terlepas dari penjadwalan sumber daya backend. Jika aplikasi Anda memerlukan penggunaan ulang konten yang stabil, explicit cache adalah pilihan tepat.
- Anda sering menggunakan kembali prompt yang sama: Saat prompt yang identik atau sangat konsisten dikirim berulang kali, explicit cache secara signifikan mengurangi biaya. Pembuatan cache hanya dikenai biaya tambahan 25% dibanding harga input standar, sedangkan setiap hit berikutnya menghemat 90%. Satu kali hit saja sudah cukup untuk mencapai titik impas.
- Anda mengelola konteks panjang dalam Agent produksi: Dalam aplikasi Agent, mekanisme umum seperti kompresi, ringkasan, dan pengingat sistem menyebabkan konteks terus berubah. Explicit cache memungkinkan Anda menyematkan dan menggunakan kembali segmen konteks kunci sehingga tetap di-cache meskipun konteks di sekitarnya berkembang.
Agent dan alat coding
Alat Agent dan coding berikut terhubung ke Model Studio melalui protokol Anthropic dan mendukung explicit cache secara native. Konfigurasikan sesuai dokumentasi masing-masing, dan alat tersebut akan secara otomatis memanfaatkan explicit cache untuk mengoptimalkan manajemen konteks.
Contoh di bawah menggunakan titik akhir Singapura. Untuk wilayah lain, ganti URL dasar dengan titik akhir regional yang sesuai.
- Claude Code
- Open Code
- OpenClaw
- Hermes
Claude Code v2.x dan versi lebih baru secara otomatis menyertakan penanda Tetapkan titik akhir protokol Anthropic:
cache_control dalam permintaan (system, env, dan pesan pengguna terbaru). Tidak diperlukan konfigurasi tambahan setelah terhubung ke titik akhir Model Studio yang kompatibel dengan Anthropic.KonfigurasiBuat atau edit ~/.claude/settings.json (Windows: C:\Users\<username>\.claude\settings.json) dengan pengaturan paket yang sesuai. Atau, hubungkan melalui variabel lingkungan:-
Token Plan (Team):
https://token-plan.ap-southeast-1.maas.aliyuncs.com/apps/anthropic -
Coding Plan:
https://coding-intl.dashscope.aliyuncs.com/apps/anthropic -
Pay-as-you-go:
https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/apps/anthropicGantiWorkspaceIddengan Workspace ID Anda yang sebenarnya.
Integrasi API
Poin-poin penting
- Tambahkan
"cache_control": {"type": "ephemeral"}ke konten pesan yang ingin Anda cache. Seluruh konten dari awal array messages hingga penanda tersebut akan di-cache sebagai satu blok. - Konten yang di-cache harus memiliki minimal 1.024 token.
- Satu permintaan mendukung hingga 4 penanda cache.
- TTL cache adalah 5 menit, diperpanjang secara otomatis setiap kali ada hit.
- Definisi tool merupakan bagian dari prompt system untuk tujuan caching. Jika definisi tool berubah, cache tidak akan terhitung.
Mulai cepat
Contoh berikut menunjukkan alur kerja dasar: permintaan pertama membuat cache, dan permintaan kedua mengenai cache tersebut.
Verifikasi status cache
Periksa bidang usage dalam respons untuk mengonfirmasi perilaku cache:
cache_creation_input_tokens: Jumlah token yang dibuat cache baru. Nilai lebih dari 0 berarti blok cache baru telah dibuat.cached_tokens(kompatibel OpenAI) ataucache_read_input_tokens(kompatibel Anthropic): Jumlah token yang mengenai cache. Nilai lebih dari 0 berarti cache berhasil dihitung.
Praktik terbaik berdasarkan skenario
Percakapan multi-putaran
Karakteristik:
- Pengguna berinteraksi dengan model dalam beberapa putaran, setiap permintaan membawa riwayat percakapan lengkap
- Kasus penggunaan khas: layanan pelanggan, tanya jawab berbasis pengetahuan, asisten coding
cache_control ke pesan terakhir dalam setiap permintaan. Setiap putaran mengenai cache yang dibuat oleh putaran sebelumnya (riwayat percakapan), sekaligus membuat cache baru yang mencakup putaran saat ini untuk putaran berikutnya.
Contoh:
Production Agent (beberapa penanda cache)
Karakteristik:
- Percakapan multi-putaran panjang yang terdiri dari: prompt system + definisi keterampilan/tool + konteks proyek + pesan pengguna / pemanggilan tool
- Bagian-bagian berbeda berubah dengan frekuensi berbeda
- Kasus penggunaan khas: asisten coding AI (Claude Code, OpenClaw), sistem tanya jawab berbasis RAG
- Prompt system — satu penanda (jarang berubah)
- Definisi keterampilan/tool — satu penanda (mungkin berubah dalam kombinasi)
- Konteks proyek — satu penanda (mungkin berganti atau dikompresi)
- Pesan pengguna / pemanggilan tool — satu penanda (bertambah setiap putaran)
- Pengguna terus bertanya tentang produk yang sama: Persona, tool, dan basis pengetahuan semuanya tidak berubah, mengenai cache pada penanda 2 (pencocokan awalan terpanjang) untuk penghematan maksimal.
- Lebih banyak putaran percakapan: Konten sebelumnya (persona + tool + basis pengetahuan + riwayat) mengenai cache putaran sebelumnya; hanya konten baru yang memerlukan cache baru.
Atur konten dari yang paling stabil ke yang paling tidak stabil: tempatkan konten yang paling jarang berubah di awal (misalnya, persona system) dan konten yang paling sering berubah di akhir (misalnya, percakapan saat ini) untuk memaksimalkan tingkat hit cache.
Pemrosesan batch (penyelesaian tugas)
Karakteristik:
- Permintaan satu putaran, tidak memerlukan memori konteks
- Prompt system panjang tetap (instruksi tugas) + input pengguna variabel (data untuk diproses)
- Kasus penggunaan khas: klasifikasi teks, pengenalan maksud, ekstraksi data, moderasi konten
cache_control hanya pada prompt system. Semua permintaan berikutnya akan mengenai cache selama prompt system tetap tidak berubah.
Contoh:
Pemanggilan Fungsi dengan definisi tool yang di-cache
Karakteristik:
- Menggunakan Pemanggilan Fungsi dengan daftar panjang definisi tool
- Definisi tool tetap tidak berubah di berbagai permintaan
tools merupakan bagian dari prompt system untuk caching. Pastikan definisi tool benar-benar identik di berbagai permintaan (urutan sama, urutan field sama, struktur sama), dan tambahkan penanda cache_control ke konten pesan.
Catatan penting
- Persyaratan format konten: Saat menambahkan
cache_control, bidang konten harus dalam bentuk array. Konten berbentuk string tidak mendukung penanda cache. - Granularitas penanda cache: Model Qwen3.5 dan versi lebih baru hanya mendukung breakpoint cache tingkat pesan. Menempatkan beberapa penanda
cache_controldalam array konten satu pesan tidak membuat breakpoint terpisah — sistem hanya menyimpan cache pada posisi penanda terakhir dalam pesan tersebut dan tidak dapat melakukan pencocokan potongan pada blok konten antara. Selain itu, beberapa pesan system digabung secara internal menjadi satu segmen dan tidak dapat berfungsi sebagai breakpoint terpisah. Untuk membuat beberapa breakpoint independen, sebarkan penandacache_controldi pesan dengan peran berbeda (misalnya, satu di system, satu di user). Model sebelum Qwen3.5 mendukung breakpoint tingkat konten (dalam pesan). - Saling eksklusif dengan cache implisit: Satu permintaan hanya dapat menggunakan satu mode caching. Jika permintaan berisi penanda
cache_control, explicit cache digunakan; jika tidak, sistem secara otomatis menggunakan cache implisit.