Skip to main content
Referência da API de reconhecimento de fala em tempo real do Paraformer

Paraformer real-time speech recognition client events

Dois eventos de cliente WebSocket controlam uma tarefa de reconhecimento de fala em tempo real do Paraformer: run-task inicia a tarefa com as configurações de modelo e áudio, e finish-task encerra a tarefa após a conclusão do fluxo de áudio. Esta página descreve a estrutura das mensagens e a semântica dos campos de ambos os eventos.

Guia do usuário: Para obter detalhes sobre o modelo e orientações de seleção, consulte Fala para texto. Fluxo de eventos: Para verificar a sequência de interação dos eventos, consulte API WebSocket.

run-task

Descrição: Inicia uma tarefa de reconhecimento de fala e define parâmetros como modelo, formato de áudio e taxa de amostragem. Quando enviar: Imediatamente após estabelecer a conexão WebSocket. Evento de resposta: O servidor deve retornar o evento task-started antes que seja possível enviar dados de áudio.
headerobject(Required)

Properties

actionstring(Required)Tipo de instrução. Defina como run-task.task_idstring(Required)ID da tarefa gerado pelo cliente no formato UUID. Serve para correlacionar eventos subsequentes a esta tarefa.streamingstring(Required)Defina como duplex.
{
    "header": {
        "action": "run-task",
        "task_id": "2bf83b9a-baeb-4fda-8d9a-xxxxxxxxxxxx",
        "streaming": "duplex"
    },
    "payload": {
        "task_group": "audio",
        "task": "asr",
        "function": "recognition",
        "model": "paraformer-realtime-v2",
        "parameters": {
            "format": "pcm",
            "sample_rate": 16000,
            "disfluency_removal_enabled": false,
            "language_hints": [
                "en"
            ]
        },
        "input": {}
    }
}
payloadobject(Required)

Properties

task_groupstring(Required)Grupo da tarefa. Defina como audio.taskstring(Required)Tipo da tarefa. Defina como asr.functionstring(Required)Tipo da função. Defina como recognition.modelstring(Required)Nome do modelo.inputobject(Required)Defina como {}.parametersobject(Required)Parâmetros de reconhecimento de fala.

Properties

formatstring(Required)Formato de áudio.Valores válidos:
  • pcm
  • wav
  • mp3
  • opus
  • speex
  • aac
  • amr
O Paraformer impõe as seguintes restrições:
  • opus e speex: Devem usar encapsulamento Ogg.
  • wav: Deve usar codificação PCM.
  • amr: Apenas AMR-NB é suportado.
sample_rateinteger(Required)Taxa de amostragem, em Hz.Valores válidos:
  • Paraformer (varia conforme o modelo):
    • paraformer-realtime-v2: Qualquer taxa de amostragem.
    • paraformer-realtime-8k-v2: Apenas 8000 Hz.
vocabulary_idstring(Optional)ID do vocabulário de palavras-chave.disfluency_removal_enabledboolean(Optional)
Apenas o Paraformer suporta este parâmetro.
Define se as palavras de preenchimento devem ser filtradas.Padrão: false.language_hintsarray[string](Optional)Idioma do áudio a ser reconhecido. Não há valor padrão. Se não definido, o modelo detecta o idioma automaticamente.Valores válidos:
  • Paraformer:
    • zh: Chinês
    • en: Inglês
    • ja: Japonês
    • yue: Cantonês
    • ko: Coreano
    • de: Alemão
    • fr: Francês
    • ru: Russo
semantic_punctuation_enabledboolean(Optional)
Apenas o Paraformer v2 suporta este parâmetro.
Define se a segmentação de frases baseada em semântica deve ser ativada.Padrão: false.
  • true: Ativa a segmentação baseada em semântica e desativa a segmentação baseada em VAD.
  • false (padrão): Ativa a segmentação baseada em VAD e desativa a segmentação baseada em semântica.
A segmentação baseada em semântica oferece maior precisão, sendo ideal para transcrição de reuniões. Já a segmentação baseada em VAD (Detecção de Atividade de Voz) apresenta menor latência, adequando-se melhor a cenários interativos.max_sentence_silenceinteger(Optional)
  • Apenas o Paraformer v2 suporta este parâmetro.
  • Tem efeito apenas quando semantic_punctuation_enabled está definido como false.
Limiar de silêncio para segmentação de frases baseada em VAD, em milissegundos. O sistema encerra a frase atual quando o silêncio após um segmento de fala excede esse limiar.Padrão: 1300.Intervalo válido: [200, 6000].multi_threshold_mode_enabledboolean(Optional)
  • Apenas o Paraformer v2 suporta este parâmetro.
  • Tem efeito apenas quando semantic_punctuation_enabled está definido como false.
Define se o modo de múltiplos limiares deve ser ativado. Quando habilitado, esse modo evita que a segmentação baseada em VAD produza segmentos excessivamente longos.Padrão: false.punctuation_prediction_enabledboolean(Optional)
Apenas o Paraformer v2 suporta este parâmetro.
Define se a pontuação deve ser adicionada aos resultados do reconhecimento.Padrão: true.heartbeatboolean(Optional)
Apenas o Paraformer v2 suporta este parâmetro.
Define se os pacotes de heartbeat devem ser ativados.Padrão: false.
  • true: Mantém a conexão ativa mesmo quando apenas áudio silencioso estiver sendo enviado.
  • false (padrão): A conexão expira e é fechada após 60 segundos de áudio silencioso.
inverse_text_normalization_enabledboolean(Optional)
Apenas o Paraformer v2 suporta este parâmetro.
Define se a Normalização Inversa de Texto (ITN) deve ser ativada. Quando habilitada, numerais chineses são convertidos para algarismos arábicos.Padrão: true.

finish-task

Descrição: Notifica o servidor de que todos os dados de áudio foram enviados e solicita o encerramento da tarefa. Quando enviar: Após enviar todos os dados de áudio. Evento de resposta: O servidor retorna o evento task-finished.
headerobject(Required)

Properties

actionstring(Required)Tipo de instrução. Defina como finish-task.task_idstring(Required)ID da tarefa gerado pelo cliente no formato UUID. Deve corresponder ao task_id utilizado no evento run-task.streamingstring(Required)Defina como duplex.
{
    "header": {
        "action": "finish-task",
        "task_id": "2bf83b9a-baeb-4fda-8d9a-xxxxxxxxxxxx",
        "streaming": "duplex"
    },
    "payload": {
        "input": {}
    }
}
payloadobject(Required)

Properties

inputobject(Required)Defina como {}.
Referência da API de Geração de Texto
Geração de Imagens
  • FAQ
Geração de Vídeo
Áudio
API em tempo real
Incorporação de Texto
Produção de Modelos