Skip to main content
Pengenalan Ucapan Non-Real-Time (Paraformer)

HTTP API pengenalan ucapan non-real-time Paraformer

Parameter dan detail API untuk HTTP API pengenalan ucapan non-real-time Paraformer.

Alibaba Cloud Model Studio telah merilis domain khusus ruang kerja untuk wilayah China (Beijing). Domain khusus baru ini memberikan performa unggul dan stabilitas lebih tinggi untuk permintaan inferensi. Kami merekomendasikan migrasi dari dashscope.aliyuncs.com ke {WorkspaceId}.cn-beijing.maas.aliyuncs.com.Ganti {WorkspaceId} dengan Workspace ID Anda yang sebenarnya. Domain yang ada tetap berfungsi penuh.
Dokumen ini hanya berlaku untuk wilayah China (Beijing). Untuk menggunakan model ini, Anda harus menggunakan Kunci API dari wilayah China (Beijing).
Panduan pengguna:Pengenalan ucapan non-real-time Layanan ini menyediakan antarmuka pengiriman tugas dan antarmuka kueri tugas. Biasanya, Anda memanggil antarmuka pengiriman tugas untuk mengunggah tugas pengenalan, lalu memanggil antarmuka kueri tugas secara berulang hingga tugas selesai.

Prasyarat

Anda telah mengaktifkan layanan dan mendapatkan Kunci API. Harap konfigurasikan Kunci API sebagai Variabel lingkungan alih-alih melakukan hardcoding di kode Anda untuk mencegah risiko keamanan akibat kebocoran kode.
Saat Anda perlu memberikan akses sementara kepada aplikasi atau pengguna pihak ketiga, atau saat ingin mengontrol secara ketat operasi berisiko tinggi seperti mengakses atau menghapus data sensitif, kami merekomendasikan penggunaan token otentikasi sementara.Dibandingkan dengan Kunci API jangka panjang, token otentikasi sementara memiliki periode validitas singkat (60 detik) dan keamanan lebih tinggi, sehingga cocok untuk skenario pemanggilan sementara dan secara efektif mengurangi risiko kebocoran Kunci API.Penggunaan: Dalam kode Anda, ganti Kunci API yang awalnya digunakan untuk otentikasi dengan token otentikasi sementara yang diperoleh.

Antarmuka pengiriman tugas

Informasi dasar

Deskripsi titik akhir APIMengirimkan tugas pengenalan ucapan.
URL
https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/audio/asr/transcription
Metode permintaanPOST
Header permintaan
Authorization: Bearer {api-key} // Ganti {api-key} dengan Kunci API Anda.
Content-Type: application/json
X-DashScope-Async: enable // Jangan menghilangkan header permintaan ini. Jika tidak, tugas tidak dapat dikirimkan.
Isi pesanKode berikut menunjukkan isi pesan yang berisi semua parameter permintaan. Anda dapat menghilangkan bidang opsional sesuai kebutuhan.
{
    "model":"paraformer-v2", // Nama model. Parameter ini wajib diisi.
    "input":{
        "file_urls":[
            "{YOUR_AUDIO_URL}"
        ] // File yang akan dikenali. Parameter ini wajib diisi.
    },
    "parameters":{
        "channel_id":[
            0
        ], // Indeks trek audio. Parameter ini opsional.
        "disfluency_removal_enabled":false, // Sakelar untuk memfilter kata-kata pengisi. Parameter ini opsional.
        "timestamp_alignment_enabled": false, // Menentukan apakah akan mengaktifkan fitur kalibrasi timestamp. Parameter ini opsional.
        "special_word_filter": "xxx", // Kata-kata sensitif. Parameter ini opsional.
        "language_hints":[ // Parameter ini hanya berlaku untuk model paraformer-v2. Jangan gunakan bidang ini untuk model lain.
            "zh",
            "en"
        ],
        "diarization_enabled":false, // Menentukan apakah akan mengaktifkan diarizasi speaker otomatis. Parameter ini opsional.
        "speaker_count": 2 // Jumlah referensi speaker. Parameter ini opsional.
    }
}

Parameter permintaan

Contoh cURL untuk antarmuka pengiriman tugas:
curl --location 'https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/audio/asr/transcription' \
     --header "Authorization: Bearer $DASHSCOPE_API_KEY" \
     --header "Content-Type: application/json" \
     --header "X-DashScope-Async: enable" \
     --data '{"model":"paraformer-v2","input":{"file_urls":["{YOUR_AUDIO_URL}"]},"parameters":{"channel_id":[0]}}'
ParameterTipeNilai defaultWajibDeskripsi
modelstring
YaNama model Paraformer yang digunakan untuk transkripsi file audio dan video. Untuk informasi selengkapnya, lihat model.
file_urlsarray[string]
YaDaftar URL untuk transkripsi file audio dan video (HTTP/HTTPS). Satu permintaan hanya mendukung 1 URL.
Jika URL berisi spasi, karakter Tionghoa, atau karakter khusus lainnya, lakukan URL-encode terlebih dahulu sebelum digunakan (misalnya, ganti spasi dengan %20). Jika tidak, unduhan dapat gagal dengan kesalahan InvalidFile.DownloadFailed.
Jika file audio Anda disimpan di OSS, RESTful API mendukung URL sementara yang diawali dengan prefiks oss://.
  • URL sementara berlaku selama 48 jam dan tidak dapat digunakan setelah kedaluwarsa. Jangan menggunakannya di lingkungan produksi.
  • API untuk mendapatkan kredensial unggah dibatasi hingga 100 QPS dan tidak mendukung penskalaan. Jangan menggunakannya di lingkungan produksi, skenario konkurensi tinggi, atau skenario uji stres.
  • Untuk lingkungan produksi, gunakan layanan penyimpanan stabil seperti OSS untuk memastikan ketersediaan file jangka panjang dan menghindari masalah pembatasan laju.
vocabulary_idstring
TidakID kosakata kustom. Didukung oleh model v2+ dengan konfigurasi bahasa. Hotword untuk ID ini berlaku untuk pengenalan ucapan saat ini. Dinonaktifkan secara default. Untuk penggunaan, lihat Hotword kustom.
channel_idarray[integer][0]TidakMenentukan indeks trek audio yang akan dikenali dalam file audio multi-trek. Indeks dimulai dari 0. Misalnya, [0] berarti mengenali trek pertama, dan [0, 1] berarti mengenali trek pertama dan kedua secara simultan. Jika parameter ini dihilangkan, hanya trek pertama yang diproses secara default.
Setiap trek yang ditentukan ditagih secara independen. Misalnya, meminta [0, 1] untuk satu file menghasilkan dua tagihan terpisah.
disfluency_removal_enabledbooleanfalseTidakMemfilter kata-kata pengisi. Dinonaktifkan secara default.
timestamp_alignment_enabledbooleanfalseTidakMengaktifkan fitur penyelarasan timestamp. Dinonaktifkan secara default.
special_word_filterstring
TidakMenentukan kata-kata sensitif yang akan diproses selama pengenalan ucapan dan mendukung pengaturan metode pemrosesan berbeda untuk kata-kata sensitif yang berbeda.Jika parameter ini tidak diberikan, sistem menggunakan logika penyaringan kata sensitif bawaan, dan kata-kata yang cocok dengan daftar kata sensitif Alibaba Cloud Model Studio dalam hasil pengenalan akan diganti dengan * dengan panjang yang sama.Jika parameter ini diberikan, strategi pemrosesan kata sensitif berikut dapat diterapkan:
  • Ganti dengan *: Ganti kata sensitif yang cocok dengan * dengan panjang yang sama.
  • Filter langsung: Hapus sepenuhnya kata sensitif yang cocok dari hasil pengenalan.
Nilai parameter ini harus berupa string JSON dengan struktur berikut:
{
  "filter_with_signed": {
    "word_list": ["test"]
  },
  "filter_with_empty": {
    "word_list": ["start", "happen"]
  },
  "system_reserved_filter": true
}
Deskripsi bidang JSON:
  • filter_with_signed
    • Tipe: Object.
    • Wajib: Tidak.
    • Deskripsi: Mengonfigurasi daftar kata sensitif yang akan diganti dengan *. Kata yang cocok dalam hasil pengenalan akan diganti dengan * dengan panjang yang sama.
    • Contoh: Menggunakan JSON di atas, hasil pengenalan ucapan untuk "Help me test this code" akan menjadi "Help me **** this code".
    • Bidang internal:
      • word_list: Array string yang mencantumkan kata sensitif yang akan diganti.
  • filter_with_empty
    • Tipe: Object.
    • Wajib: Tidak.
    • Deskripsi: Mengonfigurasi daftar kata sensitif yang akan dihapus (difilter) dari hasil pengenalan. Kata yang cocok akan dihapus sepenuhnya.
    • Contoh: Menggunakan JSON di atas, hasil pengenalan ucapan untuk "The game is about to start, right?" akan menjadi "The game is about to, right?".
    • Bidang internal:
      • word_list: Array string yang mencantumkan kata sensitif yang akan dihapus sepenuhnya (difilter).
  • system_reserved_filter
    • Tipe: Boolean.
    • Wajib: Tidak.
    • Default: true.
    • Deskripsi: Apakah akan mengaktifkan aturan kata sensitif bawaan sistem. Saat diatur ke true, logika penyaringan kata sensitif bawaan sistem juga diaktifkan, dan kata-kata yang cocok dengan daftar kata sensitif Alibaba Cloud Model Studio dalam hasil pengenalan akan diganti dengan * dengan panjang yang sama.
language_hintsarray[string]["zh", "en"]TidakMenentukan kode bahasa dari ucapan yang akan dikenali.Parameter ini hanya berlaku untuk model paraformer-v2.Kode bahasa yang didukung:
  • zh: Bahasa Tionghoa
  • en: Bahasa Inggris
  • ja: Bahasa Jepang
  • yue: Bahasa Kanton
  • ko: Bahasa Korea
  • de: Bahasa Jerman
  • fr: Bahasa Prancis
  • ru: Bahasa Rusia
diarization_enabledbooleanfalseTidakDiarizasi speaker otomatis. Dinonaktifkan secara default.Hanya berlaku untuk audio mono. Audio multi-channel tidak mendukung diarizasi speaker.Saat fitur ini diaktifkan, hasil pengenalan akan menyertakan bidang speaker_id untuk membedakan speaker yang berbeda.
Jika diarizasi speaker diaktifkan, disarankan agar durasi audio tidak melebihi 2 jam, jika tidak pengenalan dapat gagal atau timeout.
Untuk contoh speaker_id, lihat Deskripsi hasil pengenalan.
speaker_countinteger
TidakNilai referensi jumlah speaker (integer dari 2 hingga 100, inklusif).Berlaku saat diarization_enabled bernilai true.Jumlah speaker ditentukan secara otomatis secara default. Mengonfigurasi parameter ini membantu algoritma menargetkan jumlah yang ditentukan tetapi tidak menjamin output yang tepat.

Parameter respons

{
  "output": {
    "task_status": "PENDING",
    "task_id": "c2e5d63b-96e1-4607-bb91-************"
  },
  "request_id": "77ae55ae-be17-97b8-9942--************"
}

Parameter

Type

Description

audio_format

string

Format audio dari file sumber.

channels

array[integer]

Informasi indeks Track audio dari file sumber. Mengembalikan [0] untuk audio mono, [0, 1] untuk audio dua Track, dan seterusnya.

original_sampling_rate

integer

Laju pengambilan sampel (Hz) audio dalam file sumber.

original_duration

integer

Durasi audio asli (ms) dari file sumber.

channel_id

integer

Indeks Track audio dari hasil transkripsi, dimulai dari 0.

content_duration

integer

Durasi (ms) konten yang diidentifikasi sebagai ucapan dalam Track audio.

Layanan model speech recognition Paraformer hanya mentranskripsi dan mengukur konten yang diidentifikasi sebagai ucapan dalam Track audio, serta menagih sesuai dengan itu. Konten non-ucapan tidak diukur maupun ditagih. Umumnya, durasi konten ucapan lebih pendek daripada durasi audio asli. Karena penentuan keberadaan konten ucapan dilakukan oleh model AI, mungkin terdapat sedikit penyimpangan dari situasi aktual.

transcript

string

Hasil transkripsi ucapan tingkat paragraf.

sentences

array

Hasil transkripsi ucapan tingkat kalimat.

words

array

Hasil transkripsi ucapan tingkat kata.

begin_time

integer

Timestamp awal (ms).

end_time

integer

Timestamp akhir (ms).

text

string

Hasil transkripsi ucapan.

speaker_id

integer

Indeks speaker saat ini, dimulai dari 0, digunakan untuk membedakan speaker yang berbeda.

Bidang ini hanya ditampilkan dalam hasil pengenalan ketika speaker diarization diaktifkan.

punctuation

string

Tanda baca yang diprediksi setelah kata tersebut (jika ada).

Antarmuka kueri tugas

Informasi dasar

Deskripsi titik akhir APIMenanyakan status dan hasil tugas pengenalan ucapan.
URL
https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/tasks/{task_id}
Metode permintaanGET
Header permintaan
Authorization: Bearer {api-key} // Ganti {api-key} dengan Kunci API Anda.
Isi pesanTidak ada.

Parameter permintaan

curl --location 'https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/tasks/{task_id}' --header "Authorization: Bearer $DASHSCOPE_API_KEY"

Parameter

Tipe

Nilai default

Wajib

Deskripsi

task_id

string

-

Ya

ID tugas yang diperlukan untuk kueri. Dikembalikan oleh antarmuka pengiriman tugas.

Parameter respons

Jika tugas berisi beberapa subtugas, status keseluruhan tugas ditandai sebagai SUCCEEDED jika ada subtugas yang berhasil. Anda harus memeriksa bidang subtask_status untuk menentukan hasil setiap subtugas.
  • Contoh normal
  • Contoh pengecualian
{
  "request_id": "f9e1afad-94d3-997e-a83b-************",
  "output": {
    "task_id": "f86ec806-4d73-485f-a24f-************",
    "task_status": "SUCCEEDED",
    "submit_time": "2024-09-12 15:11:40.041",
    "scheduled_time": "2024-09-12 15:11:40.071",
    "end_time": "2024-09-12 15:11:40.903",
    "results": [
      {
        "file_url": "{YOUR_AUDIO_URL}",
        "transcription_url": "https://dashscope-result-bj.oss-cn-beijing.aliyuncs.com/pre/filetrans-16k/20240912/15%3A11/409a4b92-445b-4dd8-8c1d-f110954d82d8-1.json?Expires=1726211500&OSSAccessKeyId=YOUR_ACCESS_KEY_ID&Signature=YOUR_SIGNATURE",
        "subtask_status": "SUCCEEDED"
      }
    ],
    "task_metrics": {
      "TOTAL": 1,
      "SUCCEEDED": 1,
      "FAILED": 0
    }
  },
  "usage": {
    "duration": 9
  }
}

Parameter

Tipe

Deskripsi

task_id

string

ID tugas yang dikueri.

task_status

string

Status tugas yang dikueri.

Untuk tugas dengan beberapa subtugas, task_status menunjukkan SUCCEEDED jika ada subtugas yang berhasil. Periksa bidang subtask_status untuk menentukan hasil subtugas individual.

subtask_status

string

Status subtugas.

file_url

string

URL file yang diproses dalam tugas transkripsi file.

transcription_url

string

Tautan untuk mendapatkan hasil pengenalan (berlaku 24 jam). Setelah kedaluwarsa, kueri tugas dan unduhan hasil gagal.

Hasil pengenalan disimpan sebagai JSON. Unduh dari tautan ini atau baca langsung melalui permintaan HTTP.

Untuk detail bidang JSON, lihat Deskripsi hasil pengenalan.

Deskripsi hasil pengenalan

Hasil pengenalan disimpan sebagai file JSON.
{
    "file_url":"{YOUR_AUDIO_URL}",
    "properties":{
        "audio_format":"pcm_s16le",
        "channels":[
            0
        ],
        "original_sampling_rate":16000,
        "original_duration_in_milliseconds":3834
    },
    "transcripts":[
        {
            "channel_id":0,
            "content_duration_in_milliseconds":3720,
            "text":"Hello world, this is the Alibaba speech laboratory.",
            "sentences":[
                {
                    "begin_time":100,
                    "end_time":3820,
                    "text":"Hello world, this is the Alibaba speech laboratory.",
                    "sentence_id":1,
                    "speaker_id":0, //Bidang ini hanya ditampilkan saat diarizasi speaker otomatis diaktifkan
                    "words":[
                        {
                            "begin_time":100,
                            "end_time":596,
                            "text":"Hello ",
                            "punctuation":""
                        },
                        {
                            "begin_time":596,
                            "end_time":844,
                            "text":"world",
                            "punctuation":", "
                        }
                        // Konten lain dihilangkan di sini
                    ]
                }
            ]
        }
    ]
}
Parameter utama adalah sebagai berikut:

Parameter

Type

Deskripsi

audio_format

string

Format audio file sumber.

channels

array[integer]

Informasi indeks trek audio file sumber. Mengembalikan [0] untuk audio mono, [0, 1] untuk audio dua trek, dan seterusnya.

original_sampling_rate

integer

Laju sampling (Hz) audio dalam file sumber.

original_duration

integer

Durasi audio asli (ms) file sumber.

channel_id

integer

Indeks trek audio hasil transkripsi, dimulai dari 0.

content_duration

integer

Durasi (ms) konten yang diidentifikasi sebagai ucapan dalam trek audio.

Layanan model pengenalan ucapan Paraformer hanya mentranskripsi dan mengukur konten yang diidentifikasi sebagai ucapan dalam trek audio, dan menagih sesuai dengan itu. Konten non-ucapan tidak diukur maupun ditagih. Biasanya, durasi konten ucapan lebih pendek daripada durasi audio asli. Karena penentuan keberadaan konten ucapan dilakukan oleh model AI, mungkin terdapat sedikit penyimpangan dari situasi aktual.

transcript

string

Hasil transkripsi ucapan tingkat paragraf.

sentences

array

Hasil transkripsi ucapan tingkat kalimat.

words

array

Hasil transkripsi ucapan tingkat kata.

begin_time

integer

Timestamp mulai (ms).

end_time

integer

Timestamp akhir (ms).

text

string

Hasil transkripsi ucapan.

speaker_id

integer

Indeks speaker saat ini, dimulai dari 0, digunakan untuk membedakan speaker yang berbeda.

Bidang ini hanya ditampilkan dalam hasil pengenalan saat diarizasi speaker diaktifkan.

punctuation

string

Tanda baca yang diprediksi setelah kata (jika ada).

Contoh lengkap

Gunakan pustaka HTTP bawaan untuk mengimplementasikan permintaan pengiriman dan kueri tugas. Pertama kirimkan tugas pengenalan, lalu kueri berulang hingga selesai. Kode berikut memberikan contoh dalam Python:
import requests
import json
import time

api_key = "your-dashscope-api-key"  # Ganti ini dengan Kunci API Anda.
file_urls = [
    "{YOUR_AUDIO_URL}",
]
language_hints = ["zh", "en"]

# Kirim tugas transkripsi file dengan daftar URL file untuk ditranskripsi.
def submit_task(apikey, file_urls) -> str:

    headers = {
        "Authorization": f"Bearer {apikey}",
        "Content-Type": "application/json",
        "X-DashScope-Async": "enable",
    }
    data = {
        "model": "paraformer-v2",
        "input": {"file_urls": file_urls},
        "parameters": {
            "channel_id": [0],
            "language_hints": language_hints
        },
    }
    # URL layanan transkripsi file rekaman.
    service_url = (
        "https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/audio/asr/transcription"
    )
    response = requests.post(
        service_url, headers=headers, data=json.dumps(data)
    )

    # Cetak konten respons.
    if response.status_code == 200:
        return response.json()["output"]["task_id"]
    else:
        print("tugas gagal!")
        print(response.json())
        return None

# Kueri status tugas secara rekursif hingga tugas berhasil.
def wait_for_complete(task_id):
    headers = {
        "Authorization": f"Bearer {api_key}",
        "Content-Type": "application/json",
        "X-DashScope-Async": "enable",
    }

    pending = True
    while pending:
        # URL layanan kueri status tugas.
        service_url = f"https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/tasks/{task_id}"
        response = requests.get(
            service_url, headers=headers
        )
        if response.status_code == 200:
            status = response.json()['output']['task_status']
            if status == 'SUCCEEDED':
                print("tugas berhasil!")
                pending = False
                return response.json()['output']['results']
            elif status == 'RUNNING' or status == 'PENDING':
                pass
            else:
                print("tugas gagal!")
                pending = False
        else:
            print("kueri gagal!")
            pending = False
        print(response.json())
        time.sleep(0.1)

task_id = submit_task(apikey=api_key, file_urls=file_urls)
print("task_id: ", task_id)
result = wait_for_complete(task_id)
print("hasil transkripsi: ", result)

Kode kesalahan

Jika Anda mengalami kesalahan, lihat Kode kesalahan untuk troubleshooting. Jika masalah berlanjut, bergabunglah dengan komunitas developer untuk melaporkan masalah dan berikan Request ID untuk investigasi lebih lanjut. Saat tugas berisi beberapa subtugas, selama ada subtugas yang berhasil, status keseluruhan tugas ditandai sebagai SUCCEEDED. Anda perlu memeriksa bidang subtask_status untuk menentukan hasil setiap subtugas. Contoh respons kesalahan:
{
    "task_id": "7bac899c-06ec-4a79-8875-xxxxxxxxxxxx",
    "task_status": "SUCCEEDED",
    "submit_time": "2024-12-16 16:30:59.170",
    "scheduled_time": "2024-12-16 16:30:59.204",
    "end_time": "2024-12-16 16:31:02.375",
    "results": [
        {
            "file_url": "{YOUR_AUDIO_URL}",
            "code": "InvalidFile.DownloadFailed",
            "message": "File audio tidak dapat diunduh.",
            "subtask_status": "FAILED"
        }
    ],
    "task_metrics": {
        "TOTAL": 1,
        "SUCCEEDED": 0,
        "FAILED": 1
    }
}

Lebih banyak contoh

Untuk lebih banyak contoh, lihat repositori GitHub kami.

FAQ

Fitur

T: Apakah mendukung audio yang diencode Base64?

Tidak. Audio yang diencode Base64 tidak didukung. Hanya audio yang dapat diakses melalui URL publik yang didukung. Aliran biner dan pengenalan file lokal langsung tidak didukung.

T: Bagaimana cara menyediakan file audio sebagai URL publik?

Secara umum, ikuti langkah-langkah berikut (ini merupakan pendekatan umum; rincian bervariasi tergantung produk penyimpanan. Kami merekomendasikan mengunggah audio ke Alibaba Cloud OSS):
Misalnya:
  • Layanan Penyimpanan Objek (disarankan):
    • Gunakan layanan penyimpanan objek penyedia cloud (seperti Alibaba Cloud OSS) untuk mengunggah file audio ke bucket dan mengaturnya agar dapat diakses publik.
    • Keuntungan: Ketersediaan tinggi, dukungan akselerasi CDN, manajemen mudah.
  • Server web:
    • Tempatkan file audio di server web yang mendukung akses HTTP/HTTPS (seperti Nginx atau Apache).
    • Keuntungan: Cocok untuk proyek kecil atau pengujian lokal.
  • Content Delivery Network (CDN):
    • Host file audio di CDN dan akses melalui URL yang disediakan CDN.
    • Keuntungan: Pengiriman file dipercepat, cocok untuk skenario konkurensi tinggi.
Unggah file audio berdasarkan metode penyimpanan/hosting yang Anda pilih, misalnya:
  • Layanan Penyimpanan Objek:
    • Masuk ke konsol penyedia cloud dan buat bucket.
    • Unggah file audio dan atur izin file ke "baca publik" atau hasilkan tautan akses sementara.
  • Server web:
    • Tempatkan file audio di direktori yang ditentukan server (seperti /var/www/html/audio/).
    • Pastikan file dapat diakses melalui HTTP/HTTPS.
Misalnya:
  • Layanan Penyimpanan Objek:
    • Setelah diunggah, sistem secara otomatis menghasilkan URL akses publik (biasanya dalam format https://<bucket-name>.<region>.aliyuncs.com/<file-name>).
    • Jika Anda memerlukan domain yang lebih ramah pengguna, Anda dapat mengikat domain kustom dan mengaktifkan HTTPS.
  • Server web:
    • URL akses file biasanya merupakan alamat server ditambah jalur file (seperti https://your-domain.com/audio/file.mp3).
  • CDN:
    • Setelah mengonfigurasi akselerasi CDN, gunakan URL yang disediakan CDN (seperti https://cdn.your-domain.com/audio/file.mp3).
Di lingkungan jaringan publik, pastikan URL yang dihasilkan dapat diakses, misalnya:
  • Buka URL di browser dan periksa apakah file audio dapat diputar.
  • Gunakan alat (seperti curl atau Postman) untuk memverifikasi apakah URL mengembalikan respons HTTP yang benar (kode status 200).
Saat menggunakan SDK, jika file audio disimpan di Alibaba Cloud OSS, URL sementara dengan prefiks oss:// tidak didukung. Saat menggunakan RESTful API, jika file audio disimpan di Alibaba Cloud OSS, URL sementara dengan prefiks oss:// didukung:
  • URL sementara berlaku selama 48 jam dan tidak dapat digunakan setelah kedaluwarsa. Jangan menggunakannya di lingkungan produksi.
  • API untuk mendapatkan kredensial unggah dibatasi hingga 100 QPS dan tidak mendukung penskalaan. Jangan menggunakannya di lingkungan produksi, skenario konkurensi tinggi, atau skenario uji stres.
  • Untuk lingkungan produksi, gunakan layanan penyimpanan stabil seperti OSS untuk memastikan ketersediaan file jangka panjang dan menghindari masalah pembatasan laju.

T: Berapa lama waktu yang dibutuhkan untuk mendapatkan hasil pengenalan?

Setelah dikirimkan, tugas memasuki status antrian (PENDING). Waktu antrian tergantung pada panjang antrian dan durasi file serta tidak dapat diperkirakan secara tepat, tetapi biasanya selesai dalam beberapa menit. Harap bersabar. File audio yang lebih panjang memerlukan waktu pemrosesan lebih lama.

Troubleshooting

Jika Anda mengalami kesalahan, rujuk informasi di Kode kesalahan.

T: Apa yang harus saya lakukan jika hasil pengenalan tidak tersinkronisasi dengan pemutaran audio?

Atur parameter permintaan timestamp_alignment_enabled ke true. Ini menyinkronkan hasil pengenalan dengan pemutaran audio.

T: Apa yang harus saya lakukan jika mendapatkan kesalahan InvalidFile.DownloadFailed setelah mengirimkan tugas?

Periksa apakah URL file berisi spasi, karakter Tionghoa, atau karakter khusus lainnya. Jika nama file mencakup spasi (misalnya, "Meeting Recording Q1 2024.mp4"), lakukan URL-encode pada nama file dengan mengganti spasi dengan %20 sebelum meneruskannya ke parameter file_urls.

T: Apa yang harus saya lakukan jika URL akses publik sementara file audio OSS tidak dapat diakses?

Atur X-DashScope-OssResourceResolve ke enable di header. Tidak disarankan. SDK Java dan SDK Python pengenalan ucapan non-real-time Paraformer tidak mendukung konfigurasi header.

T: Tidak dapat mendapatkan hasil setelah polling terus-menerus?

Ini mungkin karena pembatasan laju. Harap bersabar. Jika Anda memerlukan ekspansi kapasitas, bergabunglah dengan komunitas developer untuk mengajukan permohonan.

T: Mengapa tidak ada hasil pengenalan (tidak dapat mengenali ucapan)?

  • Periksa apakah audio memenuhi persyaratan (format, laju sampling).
  • Jika Anda menggunakan model paraformer-v2, periksa apakah pengaturan language_hints sudah benar.
  • Jika tidak ada yang menyelesaikan masalah, Anda dapat menyesuaikan hotword untuk meningkatkan pengenalan kata-kata tertentu.

Pertanyaan lainnya

Untuk pertanyaan lainnya, lihat FAQ di GitHub.
Pembuatan Gambar
  • FAQ
Video Generation
Model Dunia
Audio
Realtime API
Penyematan Teks
TokenPlan
Model production