Skip to main content
Multimodal Real-time

Referensi API kloning suara

Kloning suara dari rekaman audio berdurasi 10–20 detik tanpa pelatihan. Dokumen ini mencakup parameter dan penggunaan API kloning suara. Untuk pemanggilan model, lihat Qwen-Omni-Realtime atau Non-real-time (Qwen-Omni) .

Dokumen ini hanya berlaku untuk API kloning suara Qwen-Omni dan Qwen-Omni-Realtime. Jika Anda menggunakan model text-to-speech, lihat Sintesis ucapan.
Alibaba Cloud Model Studio telah merilis domain khusus ruang kerja untuk wilayah China (Beijing) dan Singapura. Domain khusus baru ini memberikan performa lebih unggul dan stabilitas lebih tinggi untuk permintaan inferensi. Kami merekomendasikan migrasi ke domain baru:
  • China (Beijing): dari https://dashscope.aliyuncs.com ke https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com
  • Singapura: dari https://dashscope-intl.aliyuncs.com ke https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com
{WorkspaceId} adalah ID ruang kerja Anda, yang dapat ditemukan pada halaman Workspace Details di Konsol Alibaba Cloud Model Studio. Domain yang telah ada tetap berfungsi sepenuhnya.

Persyaratan audio

Input audio berkualitas tinggi menghasilkan kloning yang lebih baik.

Item

Requirement

Supported formats

WAV (16-bit), MP3, M4A

Duration

Direkomendasikan 10 hingga 20 detik. Maksimum: 60 detik.

File size

< 10 MB

Sample rate

>= 24 kHz

Channels

Mono

Content

Audio harus berisi minimal 3 detik ucapan jelas yang berkelanjutan tanpa suara latar. Sisa durasi boleh mencakup jeda singkat (<=2 detik). Hindari musik latar, kebisingan, atau suara lain sepanjang rekaman. Gunakan audio ucapan normal sebagai input. Jangan unggah lagu atau rekaman bernyanyi.

Languages

Chinese (zh), English (en), German (de), Italian (it), Portuguese (pt), Spanish (es), Japanese (ja), Korean (ko), French (fr), Russian (ru), Thai (th), Indonesian (id), Arabic (ar), Czech (cs), Danish (da), Dutch (nl), Finnish (fi), Hebrew (he), Hindi (hi), Icelandic (is), Malay (ms), Norwegian (no), Persian (fa), Polish (pl), Swedish (sv), Tagalog (tl), Turkish (tr), Urdu (ur), Vietnamese (vi)

Dialek Tiongkok: Dongbei, Shannxi, Sichuan, Henan, Changsha, Tianjin, Hangzhou, Liaoning, Shenyang, Anshan

Memulai dengan cepat

1. Alur kerja

Kloning suara mengikuti alur kerja "buat terlebih dahulu, lalu gunakan":
  1. Buat suara Panggil API Create a voice dan unggah klip audio. Sistem menganalisis audio dan membuat suara kloning kustom. Anda harus menentukantarget_modelpada langkah ini untuk mendeklarasikan model omni mana yang akan menggerakkan suara tersebut. Jika Anda sudah memiliki suara yang dibuat (panggil API List voices untuk memeriksa), lewati langkah ini dan lanjutkan ke langkah berikutnya.
  2. Gunakan suara dalam percakapan Panggil API Omni (realtime atau non-realtime) dan masukkan suara yang diperoleh pada langkah sebelumnya. Model omni yang ditentukan pada langkah ini harus sesuai dengantarget_modeldari langkah sebelumnya.

2. Konfigurasi model dan prasyarat

Pilih model dan lengkapi prasyarat sebelum memulai.

Konfigurasi model

Kloning suara memerlukan dua model:
  • Model kloning suara: qwen-voice-enrollment
  • Model omni yang menggerakkan suara:
    • qwen3.8-omni-flash-realtime
    • qwen3.5-omni-plus-realtime
    • qwen3.5-omni-flash-realtime
    • qwen3.5-omni-plus
    • qwen3.5-omni-flash

Prasyarat

  1. Dapatkan Kunci API: Dapatkan Kunci API. Untuk keamanan, konfigurasikan Kunci API sebagai Variabel lingkungan.
  2. Instal SDK: Pastikan Anda telah menginstal SDK DashScope terbaru.
  3. Siapkan audio untuk kloning: Audio harus memenuhi Persyaratan audio.

3. Contoh end-to-end

Contoh ini melakukan kloning suara dan menggunakannya dalam percakapan. Prinsip utama: target_model yang ditentukan selama kloning harus sesuai dengan model dalam pemanggilan API Omni berikutnya. Jika tidak, sintesis gagal. Ganti file contoh voice.mp3 dengan audio Anda sendiri.
  • Realtime
  • Non-realtime
Berlaku untuk model seri Qwen3.5-Omni-Realtime. Untuk informasi lebih lanjut, lihat Qwen-Omni-Realtime.
Python
# Persyaratan: dashscope >= 1.23.9, pyaudio
import os
import requests
import base64
import pathlib
import time
import pyaudio
from dashscope.audio.qwen_omni import MultiModality, OmniRealtimeCallback, OmniRealtimeConversation
import dashscope
# Wilayah China (Beijing). Ganti {WorkspaceId} dengan ID ruang kerja Bailian Anda. URL bervariasi berdasarkan wilayah.
dashscope.base_http_api_url = "https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1"

# ======= Konfigurasi =======
DEFAULT_TARGET_MODEL = "qwen3.5-omni-plus-realtime"  # Harus menggunakan model yang sama untuk kloning dan percakapan
DEFAULT_PREFERRED_NAME = "guanyu"
DEFAULT_AUDIO_MIME_TYPE = "audio/mpeg"
VOICE_FILE_PATH = "voice.mp3"  # Jalur ke file audio lokal untuk kloning suara

def create_voice(file_path: str,
                 target_model: str = DEFAULT_TARGET_MODEL,
                 preferred_name: str = DEFAULT_PREFERRED_NAME,
                 audio_mime_type: str = DEFAULT_AUDIO_MIME_TYPE) -> str:
    """
    Buat suara kustom dan kembalikan parameter suara.
    """
    # Kunci API berbeda antara wilayah Singapura dan Beijing. Dapatkan Kunci API: https://www.alibabacloud.com/help/en/model-studio/get-api-key
    # Jika Anda belum mengatur variabel lingkungan, ganti baris berikut dengan: api_key = "sk-xxx"
    api_key = os.getenv("DASHSCOPE_API_KEY")

    file_path_obj = pathlib.Path(file_path)
    if not file_path_obj.exists():
        raise FileNotFoundError(f"File audio tidak ditemukan: {file_path}")

    base64_str = base64.b64encode(file_path_obj.read_bytes()).decode()
    data_uri = f"data:{audio_mime_type};base64,{base64_str}"

    # Berikut adalah URL wilayah Singapura. Ganti {WorkspaceId} dengan ID ruang kerja aktual Anda. URL bervariasi berdasarkan wilayah.
    url = "https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/audio/tts/customization"
    payload = {
        "model": "qwen-voice-enrollment",
        "input": {
            "action": "create",
            "target_model": target_model,
            "preferred_name": preferred_name,
            "audio": {"data": data_uri}
        }
    }
    headers = {
        "Authorization": f"Bearer {api_key}",
        "Content-Type": "application/json"
    }

    resp = requests.post(url, json=payload, headers=headers)
    if resp.status_code != 200:
        raise RuntimeError(f"Gagal membuat suara: {resp.status_code}, {resp.text}")

    try:
        return resp.json()["output"]["voice"]
    except (KeyError, ValueError) as e:
        raise RuntimeError(f"Gagal mengurai respons suara: {e}")

class SimpleCallback(OmniRealtimeCallback):
    def __init__(self, pya):
        self.pya = pya
        self.out = None
    def on_open(self):
        self.out = self.pya.open(
            format=pyaudio.paInt16,
            channels=1,
            rate=24000,
            output=True
        )
    def on_event(self, response):
        if response['type'] == 'response.audio.delta':
            self.out.write(base64.b64decode(response['delta']))
        elif response['type'] == 'conversation.item.input_audio_transcription.completed':
            print(f"[User] {response['transcript']}")
        elif response['type'] == 'response.audio_transcript.done':
            print(f"[LLM] {response['transcript']}")

if __name__ == '__main__':
    # Jika Anda belum mengatur variabel lingkungan, ganti baris berikut dengan: dashscope.api_key = "sk-xxx"
    dashscope.api_key = os.getenv("DASHSCOPE_API_KEY")
    # Berikut adalah URL wilayah Singapura. Ganti {WorkspaceId} dengan ID ruang kerja aktual Anda. URL bervariasi berdasarkan wilayah.
    url = "wss://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api-ws/v1/realtime"

    # Langkah 1: Kloning suara
    voice = create_voice(VOICE_FILE_PATH)
    print(f"Kloning suara selesai. Suara: {voice}")

    # Langkah 2: Mulai percakapan real-time dengan suara hasil kloning
    pya = pyaudio.PyAudio()
    callback = SimpleCallback(pya)
    conv = OmniRealtimeConversation(model=DEFAULT_TARGET_MODEL, callback=callback, url=url)
    conv.connect()
    conv.update_session(
        output_modalities=[MultiModality.AUDIO, MultiModality.TEXT],
        voice=voice  # Gunakan suara hasil kloning
    )
    mic = pya.open(format=pyaudio.paInt16, channels=1, rate=16000, input=True)
    print("Percakapan dimulai. Bicaralah ke mikrofon Anda (Ctrl+C untuk keluar)...")
    try:
        while True:
            audio_data = mic.read(3200, exception_on_overflow=False)
            conv.append_audio(base64.b64encode(audio_data).decode())
            time.sleep(0.01)
    except KeyboardInterrupt:
        conv.close()
        mic.close()
        callback.out.close()
        pya.terminate()
        print("\nPercakapan diakhiri")

Referensi API

Gunakan akun yang sama untuk semua API.

Create a voice

Unggah audio untuk kloning suara dan buat suara kustom.
  • URL North China 2 (Beijing):
POST https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/audio/tts/customization
Singapura:
POST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/audio/tts/customization
  • Request headers

    Parameter

    Type

    Required

    Description

    Authorization

    string

    Supported

    Token otentikasi dalam format Bearer <your_api_key>. Ganti <your_api_key> dengan Kunci API Anda yang sebenarnya.

    Content-Type

    string

    Supported

    Jenis media badan permintaan. Atur ke application/json.

  • Badan permintaan mencakup semua parameter. Abaikan bidang opsional sesuai kebutuhan. Perhatikan perbedaan antara:
    model: Model kloning suara. Atur ke qwen-voice-enrollment.target_model: Model omni yang menggerakkan suara. Nilai ini harus sesuai dengan model yang digunakan dalam pemanggilan API multimodal real-time berikutnya. Jika tidak, sintesis akan gagal.
{
    "model": "qwen-voice-enrollment",
    "input": {
        "action": "create",
        "target_model": "qwen3.5-omni-plus-realtime",
        "preferred_name": "guanyu",
        "audio": {
            "data": "https://xxx.wav"
        },
        "text": "Opsional. Transkrip audio dalam audio.data.",
        "language": "Opsional. Bahasa audio dalam audio.data, seperti zh."
    },
    "parameters": {
        "voice_clone_mode": "normal",
        "skip_audio_process": false
    }
}
  • Request parameters
    ParameterTypeDefaultRequiredDescription
    modelstring
    SupportedModel kloning suara. Atur ke qwen-voice-enrollment.
    actionstring
    SupportedJenis aksi. Atur ke create.
    target_modelstring
    SupportedModel omni yang menggerakkan suara:
    • qwen3.8-omni-flash-realtime
    • qwen3.5-omni-plus-realtime
    • qwen3.5-omni-flash-realtime
    • qwen3.5-omni-plus
    • qwen3.5-omni-flash
    Ini harus sesuai dengan model omni yang digunakan dalam pemanggilan API berikutnya. Jika tidak, sintesis gagal.
    preferred_namestring
    SupportedNama yang mudah dibaca untuk suara. Karakter yang diizinkan: angka, huruf, garis bawah. Maksimum: 16 karakter.
    Kata kunci ini muncul dalam nama suara akhir. Misalnya, jika kata kunci adalah "guanyu", nama suara yang dihasilkan adalah "qwen-omni-vc-guanyu-voice-20250812105009984-838b".
    audio.datastring
    SupportedAudio untuk kloning (ikuti Panduan perekaman saat merekam, dan pastikan audio memenuhi Persyaratan audio).Kirimkan data audio dengan salah satu cara berikut:
    1. Data URL Format: data:<mediatype>;base64,<data>
      • <mediatype>: Jenis MIME
        • WAV: audio/wav
        • MP3: audio/mpeg
        • M4A: audio/mp4
      • <data>: String yang dienkripsi Base64 dari audio Pengodean Base64 memperbesar ukuran file. Pastikan hasil pengodeannya tidak melebihi 10 MB.
      • Contoh: data:audio/wav;base64,SUQzBAAAAAAAI1RTU0UAAAAPAAADTGF2ZjU4LjI5LjEwMAAAAAAAAAAAAAAA//PAxABQ/BXRbMPe4IQAhl9
        import base64, pathlib
        
        # input.mp3 adalah file audio lokal untuk kloning suara. Ganti dengan jalur file Anda sendiri. Pastikan file memenuhi persyaratan audio.
        file_path = pathlib.Path("input.mp3")
        base64_str = base64.b64encode(file_path.read_bytes()).decode()
        data_uri = f"data:audio/mpeg;base64,{base64_str}"
        
    2. URL audio (kami merekomendasikan mengunggah audio Anda ke OSS)
      • Ukuran file tidak boleh melebihi 10 MB.
      • URL harus dapat diakses publik tanpa otentikasi.
    textstring
    UnsupportedTranskrip yang sesuai dengan audio dalam audio.data.Jika disediakan, server memvalidasi audio terhadap teks. Jika ketidaksesuaian terlalu besar, akan dikembalikan Audio.PreprocessError.
    languagestring
    UnsupportedBahasa audio dalam audio.data.Nilai yang didukung: zh (Tiongkok), en (Inggris), de (Jerman), it (Italia), pt (Portugis), es (Spanyol), ja (Jepang), ko (Korea), fr (Prancis), ru (Rusia), th (Thailand), id (Indonesia), ar (Arab), cs (Ceko), da (Denmark), nl (Belanda), fi (Finlandia), he (Ibrani), hi (Hindi), is (Islandia), ms (Melayu), no (Norwegia), fa (Persia), pl (Polandia), sv (Swedia), tl (Tagalog), tr (Turki), ur (Urdu), vi (Vietnam).Dialek Tiongkok: Dongbei, Shannxi, Sichuan, Henan, Changsha, Tianjin, Hangzhou, Liaoning, Shenyang, Anshan.Atur ini ke bahasa sebenarnya dari audio yang digunakan untuk kloning.
  • Response parameters
    {
        "output": {
            "voice": "yourVoice",
            "target_model": "qwen3.5-omni-plus-realtime"
        },
        "usage": {
            "count": 1
        },
        "request_id": "yourRequestId"
    }
    
    Parameter respons utama:

    Parameter

    Type

    Description

    voice

    string

    Nama suara. Gunakan nilai ini langsung sebagai parameter voice dalam API multimodal real-time.

    target_model

    string

    Model omni yang menggerakkan suara:

    • qwen3.8-omni-flash-realtime

    • qwen3.5-omni-plus-realtime

    • qwen3.5-omni-flash-realtime

    Ini harus sesuai dengan model yang digunakan dalam pemanggilan API multimodal real-time berikutnya. Jika tidak, sintesis gagal.

    request_id

    string

    ID Permintaan.

    count

    integer

    Jumlah operasi "buat suara" yang ditagih untuk permintaan ini. Biayanya adalah $ count × 0.01.

    Saat membuat suara, count selalu 1.

  • Sample code
    model: Model kloning suara. Atur ke qwen-voice-enrollment.target_model: Model omni yang menggerakkan suara. Nilai ini harus sesuai dengan model yang digunakan dalam pemanggilan API multimodal real-time berikutnya. Jika tidak, sintesis akan gagal.
    • curl
    • python
    • java
    Jika Anda belum mengatur Kunci API sebagai variabel lingkungan, ganti $DASHSCOPE_API_KEY dalam contoh dengan Kunci API Anda yang sebenarnya.
    # ======= Penting =======
    # Berikut adalah URL wilayah Singapura. Ganti {WorkspaceId} dengan ID ruang kerja aktual Anda. URL bervariasi berdasarkan wilayah.
    # Kunci API berbeda antar wilayah. Dapatkan Kunci API: https://www.alibabacloud.com/help/en/model-studio/get-api-key
    # === Hapus komentar ini sebelum menjalankan ===
    
    curl --location --request POST 'https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/audio/tts/customization' \
    --header "Authorization: Bearer $DASHSCOPE_API_KEY" \
    --header 'Content-Type: application/json' \
    --data '{
        "model": "qwen-voice-enrollment",
        "parameters": {"voice_clone_mode": "normal"},
        "input": {
            "action": "create",
            "target_model": "qwen3.8-omni-flash-realtime",
            "preferred_name": "guanyu",
            "audio": {"data": "https://xxx.wav"}
        }
    }'
    

List voices

Kueri suara yang telah Anda buat dengan pagination.
  • URL North China 2 (Beijing):
POST https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/audio/tts/customization
Singapura:
POST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/audio/tts/customization
  • Request headers

    Parameter

    Type

    Required

    Description

    Authorization

    string

    Supported

    Token otentikasi dalam format Bearer <your_api_key>. Ganti <your_api_key> dengan Kunci API Anda yang sebenarnya.

    Content-Type

    string

    Supported

    Jenis media badan permintaan. Atur ke application/json.

  • Request parameters

    Parameter

    Type

    Default

    Required

    Description

    model

    string

    -

    Supported

    Model kloning suara. Atur ke qwen-voice-enrollment.

    action

    string

    -

    Supported

    Jenis aksi. Atur ke list.

    page_index

    integer

    0

    Unsupported

    Indeks nomor halaman. Nilai valid: 0 hingga 1.000.000.

    page_size

    integer

    10

    Unsupported

    Jumlah item per halaman. Nilai valid: 0 hingga 1.000.000.

  • Response parameters
    {
        "output": {
            "voice_list": [
                {
                    "voice": "yourVoice1",
                    "gmt_create": "2025-08-11 17:59:32",
                    "target_model": "qwen3.5-omni-plus-realtime"
                },
                {
                    "voice": "yourVoice2",
                    "gmt_create": "2025-08-11 17:38:10",
                    "target_model": "qwen3.5-omni-plus-realtime"
                }
            ]
        },
        "usage": {
            "count": 0
        },
        "request_id": "yourRequestId"
    }
    
    Parameter respons utama:

    Parameter

    Type

    Description

    voice

    string

    Nama suara. Gunakan nilai ini langsung dalam parameter voice API multimodal real-time.

    gmt_create

    string

    Waktu saat suara dibuat.

    target_model

    string

    Model omni yang menggerakkan suara:

    • qwen3.8-omni-flash-realtime

    • qwen3.5-omni-plus-realtime

    • qwen3.5-omni-flash-realtime

    • qwen3.5-omni-plus

    • qwen3.5-omni-flash

    Ini harus sesuai dengan model omni yang digunakan dalam pemanggilan API berikutnya. Jika tidak, sintesis gagal.

    request_id

    string

    ID Permintaan.

    count

    integer

    Permintaan ini dikenai biaya berdasarkan jumlah aktual operasi 'Buat Suara'. Biaya untuk permintaan ini adalah $ count × 0.01 .

    Menampilkan daftar suara gratis. count selalu 0.

  • Sample code
    model: Model kloning suara. Nilainya tetap qwen-voice-enrollment. Jangan ubah nilai ini.
    • cURL
    • Python
    • Java
    Jika Anda belum mengatur Kunci API sebagai variabel lingkungan, ganti $DASHSCOPE_API_KEY dalam contoh dengan Kunci API Anda yang sebenarnya.
    # ======= Penting =======
    # Berikut adalah URL wilayah Singapura. Ganti {WorkspaceId} dengan ID ruang kerja aktual Anda. URL bervariasi berdasarkan wilayah.
    # Kunci API berbeda antar wilayah. Dapatkan Kunci API: https://www.alibabacloud.com/help/en/model-studio/get-api-key
    # === Hapus komentar ini sebelum menjalankan ===
    
    curl --location --request POST 'https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/audio/tts/customization' \
    --header "Authorization: Bearer $DASHSCOPE_API_KEY" \
    --header 'Content-Type: application/json' \
    --data '{
        "model": "qwen-voice-enrollment",
        "input": {
            "action": "list",
            "page_size": 10,
            "page_index": 0
        }
    }'
    

Delete a voice

Hapus suara tertentu dan bebaskan kuota yang terkait.
  • URL North China 2 (Beijing):
POST https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/audio/tts/customization
Singapura:
POST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/audio/tts/customization
  • Request headers

    Parameter

    Type

    Required

    Description

    Authorization

    string

    Supported

    Token otentikasi dalam format Bearer <your_api_key>. Ganti <your_api_key> dengan Kunci API Anda yang sebenarnya.

    Content-Type

    string

    Supported

    Jenis media badan permintaan. Atur ke application/json.

  • Request body Abaikan bidang opsional sesuai kebutuhan.
    model: Model kloning suara. Nilainya tetap qwen-voice-enrollment. Jangan ubah nilai ini.
{
    "model": "qwen-voice-enrollment",
    "input": {
        "action": "delete",
        "voice": "yourVoice"
    }
}
  • Request parameters

    Parameter

    Type

    Default

    Required

    Description

    model

    string

    -

    Supported

    Model kloning suara. Atur ke qwen-voice-enrollment.

    action

    string

    -

    Supported

    Jenis aksi. Atur ke delete.

    voice

    string

    -

    Supported

    Suara yang akan dihapus.

  • Response parameters
    {
        "usage": {
            "count": 0
        },
        "request_id": "yourRequestId"
    }
    
    Parameter respons utama:

    Parameter

    Type

    Description

    request_id

    string

    ID Permintaan.

    count

    integer

    Permintaan ini dikenai biaya berdasarkan jumlah aktual operasi 'Buat Suara'. Biaya untuk permintaan ini adalah $ count × 0.01 .

    Menghapus suara gratis. count selalu 0.

  • Sample code
    model: Model kloning suara. Nilainya tetap qwen-voice-enrollment. Jangan ubah nilai ini.
    • cURL
    • Python
    • Java
    Jika Anda belum mengatur Kunci API sebagai variabel lingkungan, ganti $DASHSCOPE_API_KEY dalam contoh dengan Kunci API Anda yang sebenarnya.
    # ======= Penting =======
    # Berikut adalah URL wilayah Singapura. Ganti {WorkspaceId} dengan ID ruang kerja aktual Anda. URL bervariasi berdasarkan wilayah.
    # Kunci API berbeda antar wilayah. Dapatkan Kunci API: https://www.alibabacloud.com/help/en/model-studio/get-api-key
    # === Hapus komentar ini sebelum menjalankan ===
    
    curl --location --request POST 'https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/audio/tts/customization' \
    --header "Authorization: Bearer $DASHSCOPE_API_KEY" \
    --header 'Content-Type: application/json' \
    --data '{
        "model": "qwen-voice-enrollment",
        "input": {
            "action": "delete",
            "voice": "yourVoice"
        }
    }'
    

Use in conversation

Untuk menggunakan suara hasil kloning dalam percakapan, lihat Memulai dengan cepat.

Kuota suara dan pembersihan otomatis

Batas total: 1.000 suara per akun.
Tidak tersedia endpoint khusus untuk penghitungan. Gunakan API List voices untuk menghitung jumlah suara Anda.
Pembersihan otomatis: Suara yang tidak digunakan selama satu tahun akan dihapus secara otomatis.

Penagihan

Kloning suara dan pemanggilan model ditagih secara terpisah:
  • Kloning suara: dikenai biaya sebesar $0,01/suara. Pembuatan yang gagal tidak dikenai biaya.
    Kuota gratis (hanya berlaku untuk wilayah China Beijing dan wilayah Internasional Singapura):
    • 1.000 pembuatan suara gratis dalam 90 hari setelah mengaktifkan Model Studio.
    • Pembuatan yang gagal tidak mengurangi kuota gratis.
    • Menghapus suara tidak mengembalikan kuota gratis.
    • Setelah kuota gratis habis atau periode 90 hari berakhir, pembuatan suara dikenai biaya sebesar $0,01/suara.
  • Percakapan menggunakan suara hasil kloning: ditagih berdasarkan penggunaan token untuk pemanggilan model. Untuk detail selengkapnya, lihat Harga inferensi model.

Hak cipta dan kepatuhan hukum

Anda bertanggung jawab atas kepemilikan dan penggunaan legal suara yang Anda unggah. Baca Perjanjian Layanan.

Panduan perekaman

Peralatan perekaman

Gunakan mikrofon peredam kebisingan atau rekam dengan ponsel dari jarak dekat di lingkungan yang tenang.

Lingkungan perekaman

Lokasi

  • Rekam di ruang tertutup kecil berukuran 10 meter persegi atau kurang.
  • Pilih ruangan dengan bahan penyerap suara, seperti busa akustik, karpet, atau gorden.
  • Hindari ruang besar terbuka, ruang konferensi, atau ruang kelas yang memiliki gema tinggi.

Kontrol kebisingan

  • Kebisingan luar ruangan: Tutup pintu dan jendela untuk menghalangi suara lalu lintas, konstruksi, dan suara eksternal lainnya.
  • Kebisingan dalam ruangan: Matikan AC, kipas, dan ballast lampu neon.
  • Rekam suara latar dengan ponsel Anda, lalu putar kembali dengan volume tinggi untuk mengidentifikasi sumber kebisingan tersembunyi.

Kontrol gema

  • Gema menyebabkan audio terdengar sumbang dan mengurangi kejelasan.
  • Kurangi pantulan dari permukaan halus dengan menutup gorden, membuka pintu lemari pakaian, serta menutupi meja dan rak menggunakan pakaian atau selimut.
  • Gunakan benda tidak beraturan, seperti rak buku dan furnitur berlapis, untuk menciptakan pantulan difus.

Penyusunan naskah

  • Sesuaikan naskah dengan skenario penggunaan target—misalnya, gunakan gaya dialog layanan pelanggan untuk skenario layanan pelanggan.
  • Pastikan naskah tidak mengandung konten sensitif atau ilegal (seperti materi politik, pornografi, atau kekerasan), karena hal tersebut dapat menyebabkan kegagalan kloning.
  • Hindari frasa pendek (seperti "halo" atau "ya"); gunakan kalimat lengkap.
  • Pertahankan koherensi semantik dan hindari jeda yang sering saat membaca. Disarankan untuk berbicara minimal 3 detik berturut-turut tanpa gangguan.
  • Anda dapat menyampaikan emosi target (seperti ramah atau serius), tetapi hindari penyampaian yang terlalu dramatis atau teatrikal. Pertahankan nada yang alami.

Langkah-langkah yang direkomendasikan

Berikut contoh penerapan menggunakan kamar tidur biasa:
  1. Tutup pintu dan jendela untuk menghalangi kebisingan eksternal.
  2. Matikan AC, kipas, dan peralatan lainnya.
  3. Tutup gorden untuk mengurangi pantulan dari kaca.
  4. Tutup permukaan meja dengan kain atau selimut untuk mengurangi pantulan.
  5. Pahami naskah, tentukan nada karakter, dan sampaikan secara alami.
  6. Pertahankan jarak sekitar 10 cm dari perangkat perekam untuk menghindari distorsi plosif atau sinyal lemah.

Pesan kesalahan

Jika Anda mengalami kesalahan, lihat Kode Kesalahan untuk pemecahan masalah.
Pembuatan Gambar
  • FAQ
Video Generation
Model Dunia
Audio
  • Pembuatan audio
Realtime API
Penyematan Teks
TokenPlan
Model production