Dois eventos de cliente WebSocket controlam uma tarefa de reconhecimento de fala em tempo real do Paraformer: run-task inicia a tarefa com as configurações de modelo e áudio, e finish-task encerra a tarefa após a conclusão do fluxo de áudio. Esta página descreve a estrutura das mensagens e a semântica dos campos de ambos os eventos.
Guia do usuário: Para obter detalhes sobre o modelo e orientações de seleção, consulte Fala para texto.
Fluxo de eventos: Para verificar a sequência de interação dos eventos, consulte API WebSocket.
Descrição: Inicia uma tarefa de reconhecimento de fala e define parâmetros como modelo, formato de áudio e taxa de amostragem.
Quando enviar: Imediatamente após estabelecer a conexão WebSocket.
Evento de resposta: O servidor deve retornar o evento task-started antes que seja possível enviar dados de áudio.
Descrição: Notifica o servidor de que todos os dados de áudio foram enviados e solicita o encerramento da tarefa.
Quando enviar: Após enviar todos os dados de áudio.
Evento de resposta: O servidor retorna o evento task-finished.
run-task
Descrição: Inicia uma tarefa de reconhecimento de fala e define parâmetros como modelo, formato de áudio e taxa de amostragem.
Quando enviar: Imediatamente após estabelecer a conexão WebSocket.
Evento de resposta: O servidor deve retornar o evento task-started antes que seja possível enviar dados de áudio.
headerobject(Required)
Properties action string(Required)Tipo de instrução. Defina como run-task.task_idstring(Required)ID da tarefa gerado pelo cliente no formato UUID. Serve para correlacionar eventos subsequentes a esta tarefa.streamingstring(Required)Defina como duplex. | |
payloadobject(Required)
Properties task_group string(Required)Grupo da tarefa. Defina como audio.taskstring(Required)Tipo da tarefa. Defina como asr.functionstring(Required)Tipo da função. Defina como recognition.modelstring(Required)Nome do modelo.inputobject(Required)Defina como {}.parametersobject(Required)Parâmetros de reconhecimento de fala.
Properties format string(Required)Formato de áudio.Valores válidos:
integer(Required)Taxa de amostragem, em Hz.Valores válidos:
string(Optional)ID do vocabulário de palavras-chave.disfluency_removal_enabledboolean(Optional)Define se as palavras de preenchimento devem ser filtradas.Padrão: false.language_hintsarray[string](Optional)Idioma do áudio a ser reconhecido. Não há valor padrão. Se não definido, o modelo detecta o idioma automaticamente.Valores válidos:
boolean(Optional)Define se a segmentação de frases baseada em semântica deve ser ativada.Padrão: false.
integer(Optional)Limiar de silêncio para segmentação de frases baseada em VAD, em milissegundos. O sistema encerra a frase atual quando o silêncio após um segmento de fala excede esse limiar.Padrão: 1300.Intervalo válido: [200, 6000].multi_threshold_mode_enabledboolean(Optional)Define se o modo de múltiplos limiares deve ser ativado. Quando habilitado, esse modo evita que a segmentação baseada em VAD produza segmentos excessivamente longos.Padrão: false.punctuation_prediction_enabledboolean(Optional)Define se a pontuação deve ser adicionada aos resultados do reconhecimento.Padrão: true.heartbeatboolean(Optional)Define se os pacotes de heartbeat devem ser ativados.Padrão: false.
boolean(Optional)Define se a Normalização Inversa de Texto (ITN) deve ser ativada. Quando habilitada, numerais chineses são convertidos para algarismos arábicos.Padrão: true. |
finish-task
Descrição: Notifica o servidor de que todos os dados de áudio foram enviados e solicita o encerramento da tarefa.
Quando enviar: Após enviar todos os dados de áudio.
Evento de resposta: O servidor retorna o evento task-finished.
headerobject(Required)
Properties action string(Required)Tipo de instrução. Defina como finish-task.task_idstring(Required)ID da tarefa gerado pelo cliente no formato UUID. Deve corresponder ao task_id utilizado no evento run-task.streamingstring(Required)Defina como duplex. | |
payloadobject(Required)
Properties input object(Required)Defina como {}. |