Model Studio menyediakan pemantauan model, peringatan, dan pencatatan log sehingga Anda dapat memantau panggilan model secara real-time, mendeteksi anomali dengan cepat, serta melakukan troubleshooting terhadap masalah.
Ikhtisar pemantauan model
Model Studio menyediakan pemantauan model terpadu. Panggilan akan tercermin dalam grafik pemantauan sekitar 1 hingga 2 menit (maksimal 5 menit) setelah terjadi, membantu Anda melacak panggilan model secara real-time. Data pemantauan diisolasi berdasarkan ruang kerja: Anda hanya dapat melihat data untuk ruang kerja yang saat ini dipilih. Data pemantauan hanya bersifat referensi dan tidak digunakan sebagai dasar penagihan. Untuk rekonsiliasi, lihat tagihan Anda di Biaya dan Pengeluaran.
Filter data pemantauan berdasarkan dimensi
Anda dapat memfilter data pemantauan berdasarkan Time (preset cepat dan kustom), Inference Type, dan API key (semua secara default; menampilkan ID dan deskripsi, serta hanya mencantumkan API key yang ada di ruang kerja saat ini). Pemfilteran berdasarkan granularitas waktu hanya tersedia di halaman detail pemantauan model.
Lihat skala dan kondisi kesehatan panggilan secara keseluruhan
Halaman ikhtisar menampilkan kartu data seperti total model, total panggilan, total kegagalan, durasi panggilan rata-rata, dan waktu rata-rata hingga token pertama (latensi token pertama), sehingga Anda dapat dengan cepat menilai skala dan kondisi kesehatan panggilan secara keseluruhan.
Lihat detail pemantauan atau log untuk suatu model
Daftar model menampilkan data pemantauan untuk setiap model di ruang kerja saat ini. Klik View details untuk membuka halaman detail pemantauan model, atau klik View Logs untuk membuka tab Audit Log di halaman log. Masuk ke Konsol Model Studio, lalu di panel navigasi sisi kiri pilih Model Monitoring & Alerting untuk membuka halaman ikhtisar pemantauan.
Detail pemantauan model
Di halaman ikhtisar pemantauan, temukan model target dalam daftar model dan klik View details untuk membuka halaman detail pemantauan model tersebut. Jalur navigasi di bagian atas halaman adalah: Model monitoring > nama model.
Halaman detail menampilkan statistik panggilan dan grafik performa untuk satu model serta menyediakan entri untuk mengonfigurasi peringatan: ikon lonceng peringatan pada grafik metrik memungkinkan Anda mengonfigurasi peringatan dengan cepat untuk model atau metrik saat ini (untuk manajemen aturan lintas-model secara lengkap, lihat bagian Peringatan). Filternya sama seperti di halaman ikhtisar (waktu, granularitas waktu, jenis inferensi, dan API key), dan pengaturan dari halaman ikhtisar akan dipertahankan saat Anda masuk dari halaman tersebut. Untuk melihat log, kembali ke daftar model di halaman ikhtisar dan klik entri View logs (lihat bagian Logging).
Metrik pemantauan
Di halaman detail, metrik ditampilkan dalam dua kelompok—statistik panggilan dan performa. Makna, catatan referensi, dan dukungan peringatan untuk setiap metrik tercantum dalam tabel berikut.
Metric | Description | Reference | Alerting support |
|---|---|---|---|
Calls | Total jumlah panggilan model | Bervariasi tergantung bisnis | Dapat dikonfigurasi |
Usage | Total token | Bervariasi tergantung bisnis | Dapat dikonfigurasi |
Failures | Jumlah panggilan gagal | Bervariasi tergantung bisnis | Dapat dikonfigurasi |
Failure rate | Kegagalan dibagi dengan total panggilan | Bervariasi tergantung bisnis | Dapat dikonfigurasi |
Call duration | Total waktu dari permintaan hingga respons | Bervariasi tergantung model dan skenario | Dapat dikonfigurasi |
Time to first token | Latensi dari permintaan hingga token pertama dikembalikan | Bervariasi tergantung model dan skenario | Dapat dikonfigurasi |
Subsequent token latency | Rata-rata waktu untuk menghasilkan setiap token setelah yang pertama | Bervariasi tergantung model dan skenario | Tidak didukung |
Model TotalToken consumption | Total token yang dikonsumsi, diagregasi berdasarkan model (metrik khusus untuk template peringatan preset) | Bervariasi tergantung bisnis | Dapat dikonfigurasi |
Average usage per request | Rata-rata token per permintaan | Bervariasi tergantung bisnis | Tidak didukung |
Content moderation error count | Jumlah blokir moderasi konten | Bervariasi tergantung bisnis | Tidak didukung |
Rate limiting error count | Jumlah pemicu pembatasan laju kode 429 | Bervariasi tergantung bisnis | Dapat dikonfigurasi |
RPM | Requests per minute | Bervariasi tergantung bisnis | Tidak didukung |
TPM | Tokens per minute | Bervariasi tergantung bisnis | Tidak didukung |
Output tokens per second (TPS) | Output tokens per second | Bervariasi tergantung model dan skenario | Tidak didukung |
Konfigurasi ikon lonceng peringatan
Metrik yang mendukung peringatan menampilkan ikon lonceng peringatan pada grafiknya. Klik lonceng tersebut untuk membuka panel samping konfigurasi aturan peringatan (untuk detail bidang, lihat bagian manajemen aturan peringatan). Ikon lonceng dan label status panel samping memiliki makna sebagai berikut:
Type | Status | Color | Meaning |
|---|---|---|---|
Bell icon | No alert configured | Gray | Tidak ada aturan peringatan yang dikonfigurasi; klik untuk membuka panel samping konfigurasi |
Bell icon | Alert configured, normal | Blue | Aturan telah dikonfigurasi dan saat ini tidak dipicu; klik untuk melihat detail aturan |
Bell icon | Alerting | Red | Peringatan sedang dipicu; klik untuk melihat detail pemicuan |
Side-panel label | Normal | Green | Aturan telah dikonfigurasi dan statusnya normal |
Side-panel label | Alerting | Red | Peringatan sedang dipicu |
Side-panel label | Disabled | Gray | Aturan dimatikan dan tidak lagi menghasilkan peringatan |
Field | Normal | Recovered | Alerting |
|---|---|---|---|
Alert rule name | Shown | Shown | Shown |
Alert rule ID | Shown | Shown | Shown |
Alert content | Shown | Shown | Shown |
Alert metric | Shown | Shown | Shown |
Notification recipients | Shown | Shown | Shown |
Alert target | Shown | Shown | Shown |
Start time | Hidden | Shown | Shown |
Duration | Hidden | Shown | Shown |
Alert count | Hidden | Shown | Shown |
Status | Hidden | Shown | Shown |
Recovery time | Hidden | Shown | Hidden |
Peringatan
Model Studio menyediakan tiga fitur peringatan—aturnya peringatan, template peringatan, dan riwayat peringatan—semuanya terletak di bawah tab Alert rules, Alert templates, dan Alert history di halaman Model Monitoring & Alerting.
Manajemen aturan peringatan
Di halaman Model Monitoring & Alerting, klik tab Alerting untuk membuka halaman manajemen aturan peringatan. Daftar aturan peringatan menampilkan aturan peringatan yang saat ini berlaku dan mendukung pembuatan, pengeditan, penghentian, serta penghapusan aturan. Daftar ini menampilkan penerima notifikasi (kontak atau grup kontak) dan mendukung berbagai saluran seperti email.
Jalur lengkap untuk mengatur peringatan pertama kali: pertama-tama selesaikan otorisasi peran terkait layanan CloudMonitor di Pengiriman data > Pengiriman data pemantauan, lalu buat aturan peringatan di bagian ini (pilih template peringatan dan isi bidang-bidangnya), dan akhirnya konfigurasikan notifikasi peringatan (kontak atau grup kontak, rentang waktu notifikasi, dan kebijakan pengulangan).
- Klik Create Alert Rule untuk membuka halaman baru.
- Isi nama peringatan, template peringatan, model, durasi, periode pemeriksaan peringatan, konten peringatan, dan tingkat peringatan sesuai deskripsi bidang di bawah ini.
- Konfigurasikan notifikasi peringatan (kontak atau grup kontak peringatan, rentang waktu notifikasi, dan kebijakan pengulangan), lalu klik Create untuk menyelesaikan.
Field | Required | Description |
|---|---|---|
Alert name | Required | Maksimal 50 karakter. |
Alert template | Required | Pilih template preset atau kustom dari daftar drop-down, atau buat dengan menyimpan berdasarkan template. |
Model | Required | Maksimal 50 model. |
Duration | Required | Dinyatakan dalam menit. |
Alert check period | Required | Default 60 detik, dalam satuan detik; harus bilangan bulat tidak kurang dari 0 (0 berarti peringatan langsung dikirim saat dipicu). |
Alert content | Required | Maksimal 200 karakter; mendukung variabel (Anda dapat menyisipkan placeholder seperti workspace, model, dan nilai saat ini). |
Alert level | Optional | INFO / WARNING / ERROR / CRITICAL. Default INFO. |
Alert contacts / contact groups | Multiple allowed | Bersumber dari kontak atau grup kontak CloudMonitor. |
Notification time range | Required | Interval apa pun dalam 24 jam, dan dapat mencakup hari berikutnya (misalnya, 23.00 hingga 01.00 hari berikutnya). |
Repeat policy | Required | Tanpa eskalasi berarti peringatan hanya dikirim sekali selama belum terselesaikan; alternatifnya, tentukan interval jam-plus-menit untuk mengulang notifikasi. |
- Di atas daftar aturan peringatan, klik Migrate now atau Migrate alert rules.
- Confirm the migration source. Lihat nama dan status instans Prometheus, lalu klik Start detection.
- Check alert rules. Sistem mendeteksi aturan peringatan mana yang dapat dimigrasikan dan mana yang tidak kompatibel. Pilih dan konfirmasi, lalu klik Start migration.
- Migrate alert rules. Selama migrasi, status "Migrating" akan ditampilkan. Setelah migrasi selesai, hasil sukses atau gagal akan ditampilkan. Jika migrasi gagal, Anda dapat mencoba ulang. Setelah migrasi berhasil, tutup kotak dialog.
Template peringatan
Template peringatan adalah konfigurasi peringatan dengan kondisi pemicu yang telah ditentukan sebelumnya. Anda dapat dengan cepat membuat aturan peringatan berdasarkan template tanpa mengonfigurasi dari awal. Sistem menyediakan 12 template preset, dan Anda juga dapat membuat sendiri. Tab Alert templates berada di halaman Model Monitoring & Alerting, setara dengan tab Alert rules dan Alert history.
Klik Create alert template untuk membuka panel samping pembuatan template peringatan, lalu isi informasi berikut:
- Template name: Wajib diisi, maksimal 20 karakter.
- Parameter: Maksimal 10 parameter. Pilih untuk memicu peringatan saat semua aturan memenuhi kondisi (AND) atau saat salah satu memenuhi kondisi (OR).
- Metric: Wajib diisi. Pilih metrik yang akan dipantau untuk peringatan. Opsi drop-down mencakup calls, failures, failure rate, call duration, dan time to first token.
- Alert Threshold: Wajib diisi. Pilih operator perbandingan (>, >=, <, <=, ==, !=) dan nilai.
- Cycle: Dalam satuan menit. Rentang valid 1 hingga 10080 menit.
Preset alert template name | Metric |
|---|---|
Model call failures: 1-minute sum > 10 | Model call failures |
Model call failure ratio: 1-minute sum > 1% | Model call failure ratio |
Model 4xx calls: 1-minute sum > 10 | Model 4xx calls |
Model 4xx ratio: 1-minute sum > 1% | Model 4xx ratio |
Model 429 calls: 1-minute sum > 10 | Model 429 calls |
Model 429 ratio: 1-minute sum > 1% | Model 429 ratio |
Model 5xx calls: 1-minute sum > 10 | Model 5xx calls |
Model 5xx ratio: 1-minute sum > 1% | Model 5xx ratio |
Model calls: 1-minute sum > 500 | Model calls |
Model call duration: 1-minute average > 60 seconds | Model call duration |
Model time to first token: 1-minute average > 10 seconds | Model time to first token (first-token latency) |
Model TotalToken consumption: 1-minute sum > 10000 | Model TotalToken consumption |
Riwayat peringatan
Di halaman Model Monitoring & Alerting, klik tab History untuk melihat catatan pemicuan peringatan. Di daftar riwayat peringatan, penerima notifikasi hanya menampilkan informasi kontak, bukan saluran notifikasi terkait.
Riwayat peringatan dapat difilter berdasarkan empat kondisi: waktu peringatan (preset cepat dan kalender), aturan peringatan, tingkat peringatan, dan status (Recovered atau Alerting).
Daftar riwayat peringatan menampilkan kolom-kolom berikut.
Column | Description |
|---|---|
Alert instance | Identifikasi instans peringatan |
Alert level | INFO / WARNING / ERROR / CRITICAL |
Alert time | Kapan peringatan dipicu |
Alert count | Jumlah kali peringatan ini dipicu |
Alert rule | Nama dan ID aturan peringatan |
Status | Recovered atau Alerting |
Notification recipient | Kontak atau grup kontak peringatan |
Actions | View details (membuka panel samping detail peringatan) |
Logging
Model Studio mencatat audit log secara default (disimpan di platform, tidak perlu konfigurasi), menangkap informasi permintaan setiap panggilan model tetapi tidak mencakup Prompt atau Response. Log inferensi mencatat Prompt dan Response lengkap beserta langkah-langkah antaranya; log ini harus diaktifkan secara manual dan bergantung pada pengiriman log untuk menulis log ke Logstore Simple Log Service (SLS) Anda sendiri (untuk pengiriman log, lihat bagian Pengiriman data).
Audit Log
Audit log diaktifkan secara default untuk semua pengguna, tidak memerlukan konfigurasi, dan disimpan di platform Model Studio. Audit log mencatat informasi permintaan setiap panggilan model, termasuk metrik inti seperti Request ID, waktu, model, penggunaan token, latensi, dan status, tetapi tidak mencakup konten Prompt dan Response. Untuk melihat konten Prompt dan Response lengkap, aktifkan log inferensi (untuk cara mengaktifkannya, lihat bagian Inference Log).
Kondisi filter
Audit log mendukung kondisi filter berikut:
- Time range: 7 hari terakhir secara default; mendukung kueri log hingga 30 hari.
- Model: Pilihan drop-down; semua model secara default.
- API key ID: Pilihan drop-down. API key menampilkan ID dan deskripsi; jika API key dihapus, deskripsinya kosong.
- Status: Pilihan ganda, termasuk 0 (permintaan berhasil tetapi pengguna menghentikan secara aktif), 200 (sukses), 4XX (pengecualian akibat perilaku pengguna), dan 5XX (layanan tidak tersedia).
- Inference Type: Inferensi real-time secara default.
- Search Request ID: Pencocokan eksak.
Daftar log
Daftar audit log menampilkan bidang-bidang berikut: Request ID, waktu panggilan, model, penggunaan, waktu hingga token pertama, durasi panggilan, status, dan kode kesalahan. Kolom Actions menyediakan View details, yang membuka panel samping detail audit log.
Panel samping detail
Panel samping detail audit log mendukung peralihan antara tampilan daftar dan tampilan JSON:
- Informasi dasar: Request ID, waktu panggilan, model, API key.
- Penggunaan: total token, token output, token input.
- Performa: waktu hingga token pertama, durasi panggilan, kode status, kode kesalahan, dan pesan kesalahan (jika ada).
Inference Log
Log inferensi harus diaktifkan secara manual. Selain audit log, log inferensi juga mencatat Prompt dan Response lengkap beserta langkah-langkah antaranya, yang membantu debugging, optimasi, dan troubleshooting. Log inferensi disimpan di Logstore Simple Log Service Anda sendiri.
Aktifkan log inferensi
Log inferensi dinonaktifkan secara default; Anda harus terlebih dahulu mengaktifkan pengiriman audit log. Di halaman log, alihkan ke tab Inference Log (saat belum dikonfigurasi, tab ini menampilkan halaman panduan untuk mengaktifkannya) dan klik Start configuration untuk membuka kotak dialog konfigurasi pengiriman log. Anda juga dapat mengaksesnya dengan mengklik tombol Log delivery configuration di pojok kanan atas halaman log. Setelah menyelesaikan otorisasi dan konfigurasi Logstore, Anda dapat melihat daftar log inferensi.
Daftar dan detail log
Kondisi filter untuk log inferensi sama seperti audit log, kecuali filter jenis inferensi (inferensi real-time/inferensi batch) dihapus. Untuk model yang tidak mendukung log inferensi, akan ditampilkan "The current model is not supported".
Selain audit log, daftar log inferensi menambahkan data Prompt dan Response, dengan batas panjang 128 KB. Konten yang melebihi 128 KB akan dipotong; untuk konten lengkap, lihat log panggilan aktual.
Pengiriman data
Secara default, Model Studio menyimpan metrik pemantauan dan audit log di platform, sehingga Anda dapat melihatnya di konsol tanpa pengiriman apa pun. Untuk mengirimkan metrik pemantauan atau log ke layanan Alibaba Cloud Anda sendiri (untuk retensi jangka panjang atau integrasi dengan sistem O&M Anda sendiri, yang dikenai biaya layanan cloud), aktifkan pengiriman data yang sesuai: data pemantauan dikirimkan ke instans Prometheus CloudMonitor, dan log dikirimkan ke Logstore Simple Log Service (SLS). Pengiriman log juga merupakan prasyarat untuk log inferensi.
Pemantauan pengiriman data
Entri pengiriman pemantauan model terletak di pojok kiri atas halaman ikhtisar pemantauan. Pengiriman pemantauan model secara otomatis mengirimkan data pemantauan model Model Studio ke instans Prometheus Alibaba Cloud CloudMonitor untuk manajemen data pemantauan terpadu. Model Studio menyediakan metrik layanan model secara default, yang dapat Anda lihat di platform tanpa konfigurasi tambahan. Untuk mengirimkan metrik ke layanan CloudMonitor di bawah akun Anda, aktifkan pengiriman data dan konfigurasikan sumber daya target.
Langkah konfigurasi
Bagi pengguna baru, mengonfigurasi pengiriman pemantauan model memerlukan langkah-langkah berikut:
- Otorisasi peran terkait layanan CloudMonitor.
- Aktifkan layanan CloudMonitor.
- Buat instans pemantauan Prometheus CloudMonitor.
Status pengiriman
Setelah Anda mengonfigurasi pengiriman data, indikator status akan ditampilkan di samping pengiriman pemantauan model:
- Delivering (hijau)
- Delivery failed (merah)
- Delivery not configured (abu-abu)
Pengiriman log
Entri konfigurasi pengiriman log terletak di pojok kanan atas halaman log. Di halaman ikhtisar pemantauan, pilih model untuk masuk ke halaman detailnya, lalu alihkan ke halaman log untuk melihat entri ini. Pengiriman log secara otomatis mengirimkan audit log dan log inferensi model Model Studio ke Logstore Alibaba Cloud Simple Log Service untuk manajemen data terpadu. Untuk mengirimkan log ke Simple Log Service di bawah akun Anda, aktifkan pengiriman log dan selesaikan konfigurasi.
Langkah konfigurasi
Mengonfigurasi pengiriman log untuk pertama kali memerlukan tiga langkah berikut:
- Otorisasi peran Simple Log Service.
- Aktifkan Simple Log Service.
- Buat Logstore.