Skip to main content
Pengenalan Ucapan Non-Real-Time (Paraformer)

Praktik Terbaik

Dokumen ini hanya berlaku untuk Wilayah China (Beijing). Untuk menggunakan model, Anda harus menggunakan Kunci API dari wilayah China (Beijing).

Pra-pemrosesan file video untuk meningkatkan efisiensi transkripsi file (untuk skenario pengenalan file audio)

API pengenalan suara Paraformer mendukung file video. Namun, file video biasanya besar dan memerlukan waktu lama untuk ditransfer. Kami merekomendasikan pra-pemrosesan dengan mengekstraksi track audio yang relevan untuk pengenalan suara serta menerapkan kompresi yang sesuai guna mengurangi ukuran file secara signifikan. Hal ini akan meningkatkan efisiensi throughput transkripsi file video. Berikut adalah praktik terbaik menggunakan ffmpeg untuk pra-pemrosesan.

Prasyarat

Instal ffmpeg: Kunjungi situs resmi ffmpeg.

Pra-pemrosesan file video

Gunakan ffmpeg untuk mengekstrak track audio pertama dari file video, melakukan downsampling ke 16kHz, dan mengompresnya menggunakan enkode opus.
ffmpeg -i input-video-file -ac 1 -ar 16000 -acodec libopus output-audio-file.opus
Secara umum, file audio keluaran akan jauh lebih kecil dibandingkan file video masukan. Anda kemudian dapat mengirimkan file audio ini (ditentukan oleh URL) ke API transkripsi file untuk mendapatkan hasil pengenalan suara.
Pembuatan Gambar
  • FAQ
Video Generation
Model Dunia
Audio
Realtime API
Penyematan Teks
TokenPlan
Model production