Este tópico descreve os eventos que o cliente envia ao servidor via WebSocket no service de reconhecimento de fala em tempo real Qwen-Audio-3.0-ASR-Flash-Streaming/Fun-ASR-Realtime. O conteúdo inclui as estruturas de dados e definições de campos para run-task (iniciar uma tarefa), continue-task (atualizar o contexto) e finish-task (encerrar uma tarefa).
continue-task (atualizar o contexto),
Guia do usuário: Para descrições dos modelos e orientações de seleção, consulte Speech-to-text.
Fluxo de interação de eventos: Para a sequência de interação de eventos, consulte WebSocket API.
Descrição: Inicia uma tarefa de reconhecimento de fala e define parâmetros como modelo, formato de áudio e taxa de amostragem.
Quando enviar: Envie imediatamente após o estabelecimento da conexão WebSocket.
Evento de resposta: O envio de áudio só é permitido após o servidor retornar o evento task-started.
Descrição: Atualiza o contexto da conversa durante a execução da tarefa para melhorar o reconhecimento.
Quando enviar: Envie durante a execução da tarefa sempre que precisar atualizar o contexto da conversa.
Descrição: Notifica o servidor de que todo o áudio foi enviado e solicita o encerramento da tarefa.
Quando enviar: Envie após todos os dados de áudio terem sido transmitidos.
Evento de resposta: O servidor retorna o evento task-finished.
run-task
Descrição: Inicia uma tarefa de reconhecimento de fala e define parâmetros como modelo, formato de áudio e taxa de amostragem.
Quando enviar: Envie imediatamente após o estabelecimento da conexão WebSocket.
Evento de resposta: O envio de áudio só é permitido após o servidor retornar o evento task-started.
headerobject(Required)
Properties action string(Required)O tipo de comando. Defina como run-task.task_idstring(Required)Um ID de tarefa gerado pelo cliente (formato UUID) que vincula os eventos subsequentes a esta tarefa.streamingstring(Required)Defina como duplex. | |
payloadobject(Required)
Properties task_group string(Required)O grupo da tarefa. Defina como audio.taskstring(Required)O tipo de tarefa. Defina como asr.functionstring(Required)O tipo de função. Defina como recognition.modelstring(Required)O nome do modelo. As séries de modelos Qwen-Audio-3.0-ASR-Flash-Streaming e Fun-ASR-Realtime são suportadas. Para mais detalhes, consulte Supported models and regions.inputobject(Required)O objeto de entrada. Passe {} quando nenhum contexto for fornecido.
Properties context array(object)(Optional)O contexto da conversa, que melhora a precisão do reconhecimento para vocabulário específico de domínio. Para detalhes de uso, consulte Context enhancement.
Properties role string(Required)A função da mensagem. Valores válidos:
array(object)(Required)A lista de conteúdos da mensagem.
Properties type string(Required)O tipo de conteúdo. Valores válidos:
string(Required)O conteúdo de texto. Quando type for input_text, insira os resultados de reconhecimento de turnos anteriores da fala do usuário ou uma lista de palavras específicas de domínio. Quando type for text, insira as respostas do modelo de linguagem grande em turnos anteriores.object(Required)Os parâmetros de reconhecimento de fala.
Properties format string(Required)O formato de áudio.Valores válidos:
integer(Required)A taxa de amostragem, em Hz.Valores válidos: modelos de 8 kHz suportam apenas 8000 Hz; outros modelos suportam qualquer taxa de amostragem.vocabulary_idstring(Optional)O ID de uma lista de palavras-chave pré-compilada.Gere esse ID antecipadamente chamando a API de criação de lista de palavras-chave. Passe o ID durante o reconhecimento para usar as palavras-chave da lista.Indicado para cenários onde o vocabulário é conhecido e relativamente estável, e onde há necessidade de reutilizar a mesma lista de palavras entre requisições.Para detalhes de uso, consulte Precompiled hotwords.vocabularyobject(Optional)Palavras-chave instantâneas.Passadas como pares chave-valor, onde a chave é o texto da palavra-chave (string) e o valor é o peso da palavra-chave (integer). Não é necessário criar uma lista de palavras-chave antecipadamente. O peso varia de [1, 5] ou é definido como 50: um valor em [1, 5] aumenta a probabilidade de o modelo gerar a palavra conforme o valor cresce; um valor de 50 designa uma super palavra-chave, o que melhora significativamente o recall, mas o número de super palavras-chave não pode exceder 50.Recomendado para otimização temporária de palavras-chave no nível da sessão.Quando configuradas juntamente com palavras-chave pré-compiladas, apenas as palavras-chave instantâneas terão efeito. Para detalhes de uso, consulte Instant hotwords.language_hintsarray[string](Optional)O idioma do áudio a ser reconhecido. Não há valor padrão; se não for definido, o modelo detecta o idioma automaticamente.Para a série de modelos Qwen-Audio-3.0-ASR-Flash-Streaming, é possível definir até 4 valores; se você definir mais de 4, apenas os primeiros 4 terão efeito. Para a série de modelos Fun-ASR-Realtime, é possível definir apenas 1 valor; se você definir vários valores, apenas o primeiro terá efeito.
Clique em visualizar os códigos de idioma suportados
boolean(Optional)Se deve ativar a segmentação semântica.Valor padrão: false.
integer(Optional)O limiar de silêncio VAD para segmentação, em ms. Quando o silêncio após um segmento de fala excede esse limiar, o sistema determina que a frase terminou.Valor padrão: 1300.Valores válidos: [200, 6000].multi_threshold_mode_enabledboolean(Optional)Se deve ativar o modo de múltiplos limiares. Quando ativado, evita que os segmentos VAD fiquem muito longos.Valor padrão: false.heartbeatboolean(Optional)Se deve ativar pacotes de heartbeat.Valor padrão: false.
float(Optional)O limiar para distinguir fala de ruído, usado para ajustar a sensibilidade da Detecção de Atividade de Voz (VAD).Valores válidos: [-1,0, 1,0].Descrições dos valores:
string(Optional)Especifica as palavras sensíveis a serem processadas durante o reconhecimento de fala e permite definir diferentes métodos de processamento para cada palavra. Para mais detalhes, consulte Sensitive word filtering. |
continue-task
Descrição: Atualiza o contexto da conversa durante a execução da tarefa para melhorar o reconhecimento.
Quando enviar: Envie durante a execução da tarefa sempre que precisar atualizar o contexto da conversa.
headerobject(Required)
Properties action string(Required)O tipo de comando. Defina como continue-task.task_idstring(Required)Um ID de tarefa gerado pelo cliente (formato UUID) que deve corresponder ao task_id no evento run-task.streamingstring(Required)Defina como duplex. | |
payloadobject(Required)
Properties input object(Required)O objeto de entrada.
Properties context _array(object)___ (Optional)O contexto da conversa, que melhora a precisão do reconhecimento para vocabulário específico de domínio. Para detalhes de uso, consulte Início rápido.Propertiesrole _string_ __(Required)A função da mensagem. Valores válidos:user: Os resultados de reconhecimento de turnos anteriores da fala do usuário ou uma lista de palavras específicas de domínio.assistant: As respostas do modelo de linguagem grande em turnos anteriores.content _array(object)___(Required)A lista de conteúdos da mensagem.Propertiestype _string_ __(Required)O tipo de conteúdo. Valores válidos:input_text: Os resultados de reconhecimento de turnos anteriores da fala do usuário ou uma lista de palavras específicas de domínio (usado quando a função é user). Você também deve fornecer o campo text.text: As respostas do modelo de linguagem grande em turnos anteriores (usado quando a função é assistant). Você também deve fornecer o campo text.text _string_ __(Required)O conteúdo de texto. Quando type for input_text, insira os resultados de reconhecimento de turnos anteriores da fala do usuário ou uma lista de palavras específicas de domínio. Quando type for text, insira as respostas do modelo de linguagem grande em turnos anteriores. |
finish-task
Descrição: Notifica o servidor de que todo o áudio foi enviado e solicita o encerramento da tarefa.
Quando enviar: Envie após todos os dados de áudio terem sido transmitidos.
Evento de resposta: O servidor retorna o evento task-finished.
headerobject(Required)
Properties action string(Required)O tipo de comando. Defina como finish-task.task_idstring(Required)Um ID de tarefa gerado pelo cliente (formato UUID) que deve corresponder ao task_id no evento run-task.streamingstring(Required)Defina como duplex. | |
payloadobject(Required)
Properties input object(Required)Defina como {}. |