Skip to main content
Text Generation

Buat penerapan

Buat tugas penerapan model.

Prasyarat

Penerapan model

Endpoint

POST https://dashscope-intl.aliyuncs.com/api/v1/deployments

Contoh permintaan

  • Provisioned Throughput (PTU)
  • Model unit
  • Token usage
Setelah menjalankan perintah penerapan, penagihan dimulai segera setelah layanan berhasil diterapkan, meskipun Anda tidak menggunakannya. Sebelum melanjutkan, kami sarankan Anda meninjau aturan penagihan layanan.
Metode penagihan provisioned throughput mengenakan biaya berdasarkan durasi penggunaan. Metode ini cocok untuk skenario yang memerlukan throughput stabil, konkurensi tinggi, latensi rendah, dan trafik yang dapat diprediksi. Dalam mode ini, platform menyediakan throughput/konkurensi dan kecepatan generasi, yang tidak dapat Anda sesuaikan.
curl "https://dashscope-intl.aliyuncs.com/api/v1/deployments" \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--header 'Content-Type: application/json' \
--data '{
    "name": "my_qwen_flash",
    "model_name": "qwen-flash-2025-07-28",
    "plan": "ptu",
    "ptu_capacity": {
        "input_tpm": 10000,
	"output_tpm": 1000
    }
}'

Parameter permintaan

Parameter

Tipe

Lokasi

Wajib

Deskripsi

model_name

String

body

Yes

Nama model yang akan diterapkan. Ini sesuai dengan ID model di My Models. Anda juga bisa mendapatkan ID ini dari output operasi Create Training Job atau Create Import Job.

plan

String

body

Yes

Rencana penerapan. Metode penagihan berikut didukung:

Metode penagihan

Pengaturan rencana

Billing by model unit

"plan": "mu"

Billing by compute unit

"plan": "cu"

Provisioned throughput

"plan": "ptu"

LoRA shared deployment (billed by token usage)

"plan": "lora"

Anda dapat dengan cepat menemukan rencana penerapan yang didukung untuk model fine-tuned di My Models.

Model CosyVoice hasil fine-tuning saat ini hanya mendukung "plan": "mu".

name

String

body

Yes

Nama tampilan model di console.

capacity

Integer

body

No

Wajib hanya ketika "plan": "mu" ditentukan. Menentukan jumlah unit sumber daya untuk penerapan. Nilainya harus kelipatan bilangan bulat dari base_capacity. Batasan bervariasi berdasarkan nilai deploy_spec. Misalnya, untuk MU2, nilainya harus kelipatan 8, sedangkan untuk MU5, nilainya bisa 1. Contoh: "capacity": 1.

Model CosyVoice saat ini menyediakan dua templat penerapan berikut dengan batasan capacity yang sesuai:

  • penerapan single-node: capacity harus kelipatan bilangan bulat dari 1, seperti 1, 2, 3, 4, atau 5.

  • penerapan single-node - edisi inferensi kompleks flagship: capacity harus kelipatan bilangan bulat dari 8, seperti 8, 16, 24, atau 32.

billing_method

String

body

No

Wajib hanya ketika "plan": "mu" ditentukan. Saat ini, hanya "POST_PAY" (Post-paid) yang didukung. Contoh: "billing_method": "POST_PAY".

deploy_spec

String

body

No

Pengaturan ini hanya berlaku ketika "plan": "mu" ditentukan.

Untuk detail dukungan fitur, lihat Dukungan fitur untuk penerapan model unit.

Parameter ini wajib ketika "plan": "mu" ditentukan. Contoh: "deploy_spec": "MU1".

Anda bisa mendapatkan nilai ini dari bidang template_id yang dikembalikan oleh operasi Get Deployable Model List.

enable_thinking

Boolean

body

No

Didukung oleh beberapa model. Anda dapat mengatur ini ke true atau false.

max_context_length

Number

body

No

Didukung oleh beberapa model. Contoh: "max_context_length": 131072.

rpm_limit

Number

body

No

Didukung oleh beberapa model. Menentukan jumlah maksimum permintaan per menit (RPM).

tpm_limit

Number

body

No

Didukung oleh beberapa model. Menentukan jumlah maksimum token per menit (TPM).

ptu_capacity

Object

body

No

Pengaturan ini hanya berlaku ketika "plan": "ptu" ditentukan.

Untuk detail dukungan fitur, lihat Dukungan Fitur untuk Penerapan PTU.

Jika Anda tidak menentukan parameter ini, sistem secara default menggunakan 10.000 input_tpm dan 1.000 output_tpm.

Contoh: "ptu_capacity": { "input_tpm": 10000, "output_tpm": 1000 }.

Contoh: "ptu_capacity": { "input_tpm": 10000, "output_tpm": 1000 }.

ptu_capacity.input_tpm

Number

body

No

Didukung oleh semua model. Menentukan jumlah maksimum token input per menit (TPM).

ptu_capacity.output_tpm

Number

body

No

Didukung oleh semua model. Menentukan jumlah maksimum token output per menit (TPM).

ptu_capacity.thinking_output_tpm

Number

body

No

Didukung oleh beberapa model. Menentukan jumlah maksimum token output thinking yang disediakan per menit (TPM).

suffix

String

body

No

Setelah model diterapkan, nama model baru dihasilkan. Parameter suffix menentukan akhiran untuk nama baru ini. Akhiran tersebut harus unik secara global dan memiliki panjang maksimum 8 karakter. Anda dapat mengabaikan akhiran untuk penerapan pertama model. Jika Anda menerapkan model yang sama beberapa kali, Anda harus menentukan akhiran unik untuk setiap penerapan.

Lihat parameter output deployed_model untuk informasi lebih lanjut.

Model yang didukung

  • Pay-as-you-go
  • Penagihan berdasarkan durasi
  • Penagihan berbasis token
biaya = durasi penggunaan × (harga TPM input × TPM input + harga TPM output × TPM output)Untuk penagihan pay-as-you-go, penggunaan dihitung per jam, dan kolom "durasi 1 jam" mencantumkan harga satuan. Untuk penagihan langganan, penggunaan dihitung per hari, dan kolom "durasi 1 hari" mencantumkan harga satuan.
  • Langganan diaktifkan setelah pembayaran dan berlaku selama N hari, berakhir pada pukul 23:59 pada hari ke-N. Untuk pesanan yang dilakukan setelah pukul 22:00, tanggal kedaluwarsa diperpanjang otomatis 1 hari.
  • Setelah langganan kedaluwarsa, layanan dihentikan setelah periode tenggang 2 jam. Sumber daya kemudian disimpan selama 14 jam sebelum dilepas.
  • Anda tidak dapat menghentikan langganan lebih awal.
  • Untuk pay-as-you-go, jika akun memiliki saldo jatuh tempo, sumber daya yang diterapkan disimpan dan penagihan berlanjut selama 24 jam sebelum dilepas secara otomatis.
Ketika input model melebihi batas token maksimum atau TPM yang dibeli, panggilan ke model tersebut secara otomatis beralih ke mode pay-as-you-go. Dalam mode ini, performa inferensi dapat menurun, pembatasan laju tunduk pada batas trafik publik model snapshot saat ini di ruang kerja Anda, dan biaya dikenakan sesuai tarif standar pay-as-you-go.
  • Header respons API akan menyertakan x-dashscope-ptu-overflow:true.
  • Untuk melihat statistik TPM, buka console Model Studio.
Lihat Aturan Pengembalian Dana Penurunan Spesifikasi Konfigurasi untuk detail penyesuaian biaya dan pengembalian dana untuk skala-masuk (penurunan spesifikasi).
  • Singapura
  • China (Beijing)
  • Qwen
  • Qwen-VL
  • DeepSeek

Nama model

Kode model

Maksimum token input

Input pay-as-you-go

Per 10k TPM (per jam)

Output pay-as-you-go

Per 1k TPM (per jam)

Input langganan

Per 10k TPM (per hari)

Output langganan

Per 1k TPM (per hari)

Qwen3.6-Plus-2026-04-02

qwen3.6-plus-2026-04-02

128.000

$1,2

$0,72

$14,4

$8,64

Qwen3.5-Plus-2026-04-20

qwen3.5-plus-2026-04-20

128.000

$0,96

$0,576

$11,52

$6.912

Contoh respons

Perintah mengembalikan hasil berikut:
{
  "request_id": "f2ae64f7-83cc-410c-bc0b-840443f7eb86",
  "output": {
    "deployed_model": "emo-35b3f106-sample01",
    "gmt_create": "2025-06-17T11:00:38.68",
    "gmt_modified": "2025-06-17T11:00:38.68",
    "status": "PENDING",
    "model_name": "emo",
    "base_model": "emo",
    "base_capacity": 1,
    "capacity": 1,
    "ready_capacity": 0,
    "workspace_id": "llm-v71tlv3d***",
    "charge_type": "post_paid",
    "creator": "175805416***",
    "modifier": "175805416***"
  }
}

Parameter respons

ParameterTipeDeskripsi
request_idStringID permintaan.
outputObjectDetail tugas penerapan.
deployed_modelStringPengidentifikasi unik untuk model yang diterapkan. ID ini digunakan dalam operasi API, seperti menanyakan detail penerapan, memodifikasi pembatasan laju penerapan, penskalaan penerapan, dan menghapus penerapan, serta diteruskan sebagai parameter SDK saat Anda memanggil model.
gmt_createStringWaktu pembuatan tugas penerapan.
gmt_modifiedStringWaktu modifikasi terakhir tugas penerapan.
statusStringStatus tugas penerapan.
  • PENDING: Tugas sedang dibuat.
  • UPDATING: Tugas sedang diperbarui.
  • RUNNING: Tugas penerapan sedang berjalan, dan model yang diterapkan dapat memproses permintaan.
  • STOPPED: Tugas penerapan dihentikan dan tidak ditagih.
  • DELETING: Tugas sedang dihapus.
  • FAILED: Pembuatan atau pembaruan tugas gagal.
model_nameStringNama model yang digunakan dalam tugas penerapan.
base_modelStringID model dasar yang digunakan dalam tugas penerapan.
base_capacityNumberJumlah minimum unit sumber daya yang diperlukan untuk menjalankan model dasar.
capacityNumberJumlah unit sumber daya yang digunakan oleh tugas penerapan.
ready_capacityNumberJumlah unit sumber daya yang siap memproses permintaan segera. Kecepatan inisialisasi sumber daya atau status perangkat keras dapat membatasi nilai ini.
workspace_idStringID ruang kerja tugas penerapan.
charge_typeStringMetode penagihan untuk tugas penerapan.
post_paid: Post-paid.
creatorStringUID pengguna yang membuat tugas penerapan.
modifierStringUID pengguna yang terakhir memodifikasi tugas penerapan.
planStringModel penagihan untuk tugas penerapan. Parameter ini tidak dikembalikan untuk beberapa model penagihan.
Dikembalikan hanya untuk penerapan Model Unit.
model_unit_specStringSpesifikasi unit model.
enable_thinkingBooleanMenentukan apakah mode Thinking diaktifkan. Fitur ini hanya tersedia untuk model tertentu.
max_context_lengthNumberPanjang konteks maksimum.
rpm_limitStringJumlah maksimum permintaan per menit (RPM).
tpm_limitNumberJumlah maksimum token per menit (TPM).
Dikembalikan hanya untuk penerapan throughput provisioned (PTU).
ptu_capacityObjectParameter ini hanya berlaku ketika "plan": "ptu" ditetapkan.Contoh: "ptu_capacity": { "input_tpm": 10000, "output_tpm": 1000 }.
ptu_capacity.input_tpmNumberJumlah maksimum token input per menit (TPM) untuk model yang diterapkan. Fitur ini didukung oleh semua model.
ptu_capacity.output_tpmNumberJumlah maksimum token output per menit (TPM) untuk model yang diterapkan. Fitur ini didukung oleh semua model.
ptu_capacity.thinking_output_tpmNumberJumlah maksimum token output thinking per menit (TPM) untuk model yang diterapkan. Fitur ini hanya tersedia untuk model tertentu.

Respons kesalahan

Contoh respons

{
    "request_id": "ca218d57-b91b-46b2-bd35-c41c6287bcf4",
    "message": "Model: qwen-plus-20230703-cx7f not found!",
    "code": "NotFound"
}

Parameter respons

Parameter

Tipe

Deskripsi

request_id

String

ID unik permintaan.

code

String

Kode kesalahan.

message

String

Pesan kesalahan.

Kesalahan berikut dapat terjadi jika permintaan gagal:

Kode Kesalahan

Pesan Kesalahan

Alasan

NotFound

Model: xxx not found!

  • Anda membuat tugas penerapan menggunakan model yang tidak ada.

  • Anda menanyakan, memperbarui, atau menghapus tugas penerapan yang menggunakan model yang tidak ada.

Conflict

Deployed model xxx already exists, please specify a suffix.

Anda membuat tugas penerapan dengan akhiran yang sudah digunakan.

InvalidParameter

Invalid capacity (xx), capacity must be larger than or equal to 0 and multiples of 1 and less than 1000!

Anda membuat atau memperbarui tugas penerapan dengan jumlah unit kapasitas yang tidak valid.

Pembuatan Gambar
  • FAQ
Video Generation
Model Dunia
Audio
  • Pembuatan audio
Realtime API
Penyematan Teks
TokenPlan
Model production