Skip to main content
Referência da API de reconhecimento de arquivos de gravação Paraformer

Práticas recomendadas

Este documento se aplica apenas à região China (Beijing). Para usar o modelo, utilize uma API key da região China (Beijing).

Pré-processar arquivos de vídeo para melhorar a eficiência da transcrição (cenários de reconhecimento de áudio)

A API de reconhecimento de fala Paraformer aceita arquivos de vídeo, mas eles costumam ser grandes e demorados para transferir. Pré-processe os vídeos extraindo a faixa de áudio necessária para o reconhecimento de fala e compactando-a. Essa abordagem reduz significativamente o tamanho do arquivo e aumenta o throughput de transcrição. Use o ffmpeg para pré-processar os arquivos.

Pré-requisitos

Instale o ffmpeg disponível em ffmpeg.org.

Pré-processar arquivos de vídeo

Use o ffmpeg para extrair a primeira faixa de áudio, reduzir a taxa de amostragem para 16 kHz e compactar com codificação opus.
ffmpeg -i input-video-file -ac 1 -ar 16000 -acodec libopus output-audio-file.opus
O arquivo de áudio gerado será consideravelmente menor que o vídeo original. Envie o arquivo de áudio (via URL) para a API de transcrição de arquivos e obtenha os resultados do reconhecimento de fala.
Referência da API de Geração de Texto
Geração de Imagens
  • FAQ
Geração de Vídeo
Áudio
API em tempo real
Incorporação de Texto
Produção de Modelos