Este tópico descreve os parâmetros e os detalhes da interface da API HTTP de reconhecimento de fala não em tempo real Qwen-Audio-3.0-ASR-Flash/Fun-ASR-Flash.
Endpoints do service
- Singapore
- China (Beijing)
POST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generationSubstitua {WorkspaceId} pelo seu Workspace ID real.Cabeçalhos da solicitação
Parâmetro | Tipo | Obrigatório | Descrição |
|---|---|---|---|
Authorization | string | Sim | O token de autenticação, no formato |
Content-Type | string | Sim | O tipo de mídia do corpo da solicitação. Fixo como |
X-DashScope-SSE | string | Sim | Controla se os resultados são retornados como um fluxo SSE. Defina como |
Corpo da solicitação | Os exemplos a seguir usam a configuração para a região Singapore. Substitua "{WorkspaceId}" pelo ID do seu workspace real. A configuração varia entre as regiões, e a chave de API para a região Singapore difere daquela para a região Beijing.
|
modelstring(Obrigatório)O nome do modelo. As séries de modelos Qwen-Audio-3.0-ASR-Flash e Fun-ASR-Flash são suportadas. Para mais detalhes, consulte Supported models and regions. | |
inputobject(Obrigatório)As informações de entrada.
Propriedades messages array(object)(Obrigatório)A lista de mensagens. Contém o áudio a ser reconhecido e, opcionalmente, o contexto de conversação que melhora a precisão do reconhecimento.
Propriedades role string(Obrigatório)A função da mensagem. Valores válidos:
array(object)(Obrigatório)A lista de conteúdo da mensagem.
Propriedades type string(Obrigatório)O tipo de conteúdo. Cada solicitação precisa de pelo menos uma mensagem do tipo input_audio. Valores válidos:
object(Condicionalmente obrigatório)Obrigatório quando type é input_audio.
Propriedades data string(Obrigatório)Os dados de áudio a serem reconhecidos. Para requisitos de entrada, como formatos de áudio suportados, limites de tamanho de arquivo e limites de duração, consulte Audio specifications. Dois métodos são suportados:
https://example.com/audio/sample.wavExemplo (Base64): data:audio/wav;base64,{BASE64_ENCODED_DATA}string(Condicionalmente obrigatório)Quando type é input_text, insira os resultados de reconhecimento da fala do usuário de turnos anteriores ou uma lista de palavras específicas de domínio. Quando type é text, insira as respostas do modelo de linguagem grande de turnos anteriores. O comprimento do texto é medido em caracteres, onde cada caractere conta como 1. O comprimento combinado dos campos text em todas as mensagens em um único turno de contexto não pode exceder 400 caracteres. Qualquer excesso é truncado a partir do final. | |
parametersobject(Obrigatório)Os parâmetros do modelo.O Refinamento de Texto está desativado por padrão e ainda não está disponível.Refinamento de Texto: Durante a transcrição da fala, o modelo remove automaticamente palavras de preenchimento sem sentido e repetições gaguejadas, lida com autocorreções feitas durante a fala, suaviza expressões coloquiais e padroniza a pontuação e a formatação do texto. Isso resulta em uma saída mais concisa, fluente e legível, preservando ao máximo a intenção original do usuário e as informações principais.
Propriedades format string(Obrigatório)O formato do áudio. Defina este valor para corresponder ao seu formato de áudio real. Os valores suportados incluem wav, mp3 e opus. Para mais detalhes, consulte Audio specifications.sample_ratestring(Opcional)A taxa de amostragem do áudio, em Hz. Por exemplo, 16000 significa uma taxa de amostragem de 16 kHz. Para mais detalhes, consulte Audio specifications.vocabulary_idstring(Opcional)O ID de uma lista de palavras-chave pré-compilada.Gere esse ID antecipadamente chamando a API de criação de lista de palavras-chave. Passe o ID durante o reconhecimento para usar as palavras-chave da lista.Indicado para cenários onde o vocabulário é conhecido e relativamente estável, e onde você precisa reutilizar a mesma lista de palavras entre solicitações.Para detalhes de uso, consulte Precompiled hotwords.vocabularyobject(Opcional)Palavras-chave instantâneas.Passadas como pares chave-valor, onde a chave é o texto da palavra-chave (string) e o valor é o peso da palavra-chave (integer). Não é necessário criar uma lista de palavras-chave antecipadamente. O peso varia de [1, 5] ou é definido como 50: um valor em [1, 5] torna o modelo mais propenso a gerar a palavra à medida que o valor aumenta; um valor de 50 designa uma super palavra-chave, o que melhora muito a recuperação, mas o número de super palavras-chave não pode exceder 50.Adequado para otimização temporária de palavras-chave no nível da sessão.Quando configuradas juntamente com palavras-chave pré-compiladas, apenas as palavras-chave instantâneas têm efeito. Para detalhes de uso, consulte Instant hotwords.language_hints array[string](Opcional)Os códigos de idioma a serem reconhecidos. Se não for possível determinar o idioma antecipadamente, deixe este campo indefinido e o modelo detectará o idioma automaticamente.Para modelos da série Qwen-Audio-3.0-ASR-Flash, você pode definir até 4 valores; se definir mais de 4, apenas os primeiros 4 terão efeito. Para modelos da série Fun-ASR-Flash, você pode definir apenas 1 valor; se definir mais de um, apenas o primeiro terá efeito.
Clique para visualizar os códigos de idioma suportados
|
Corpo da resposta |
|
request_idstringO identificador exclusivo desta solicitação. | |
outputobjectO resultado de saída.
Propriedades text stringO texto completo reconhecido acumulado até o momento.sentenceobjectOs detalhes da frase atual.
Propriedades sentence_id integerO número da frase, começando em 1.sentence_endbooleanIndica se este é o resultado final para a frase. true indica que o reconhecimento da frase foi concluído.begin_timeintegerO horário de início da frase, em milissegundos.end_timeintegerO horário de término da frase, em milissegundos. Retornado apenas quando sentence_end é true.textstringO texto reconhecido da frase atual.channel_idintegerO número do canal, começando em 0.wordsarrayA lista de carimbos de data/hora no nível de palavra.
Propriedades text stringO texto da palavra.begin_timeintegerO horário de início da palavra, em milissegundos.end_timeintegerO horário de término da palavra, em milissegundos.punctuationstringO sinal de pontuação após a palavra. Uma string vazia quando não há pontuação.fixedbooleanIndica se a palavra está estabilizada. false indica que o carimbo de data/hora da palavra pode ser ajustado em eventos subsequentes. | |
usageobjectAs informações de uso. Retornadas apenas quando sentence_end é true.
Propriedades duration integerA duração do áudio processado, em segundos. |
Lógica de processamento de resultados de fluxo SSE
No modo de fluxo, o cliente precisa lidar com o seguinte:
- Para cada evento SSE recebido, analise o JSON no campo
data. - Use
output.sentence.sentence_endpara determinar se a frase atual terminou. Quando este valor étrue, o reconhecimento da frase está completo, os carimbos de data/hora no nível de palavra estão estabilizados e o resultado pode ser usado como final. Quando este valor éfalse, o reconhecimento ainda está em andamento, e o texto e os carimbos de data/hora podem ser atualizados em eventos subsequentes. - As informações de
usagesão retornadas apenas no evento de fim de frase, e você pode usá-las para medir a duração do áudio processado.