Pré-processar arquivos de vídeo para melhorar a eficiência da transcrição (cenários de reconhecimento de áudio)
A API de reconhecimento de fala Paraformer aceita arquivos de vídeo, mas eles costumam ser grandes e demorados para transferir. Pré-processe os vídeos extraindo a faixa de áudio necessária para o reconhecimento de fala e compactando-a. Essa abordagem reduz significativamente o tamanho do arquivo e aumenta o throughput de transcrição. Use o ffmpeg para pré-processar os arquivos.
O arquivo de áudio gerado será consideravelmente menor que o vídeo original. Envie o arquivo de áudio (via URL) para a API de transcrição de arquivos e obtenha os resultados do reconhecimento de fala.