Parâmetros de entrada e saída do modelo Qwen-ASR. Chame a API usando o protocolo compatível com OpenAI ou DashScope.
Tipos de conexão do modelo
Cada models oferece suporte a diferentes tipos de conexão.
Modelo | Tipo de conexão |
|---|---|
Qwen3-ASR-Flash-Filetrans | Suporta apenas DashScope asynchronous invocation |
Qwen3-ASR-Flash |
Compatível com OpenAI
URL
- Singapore
- China (Beijing)
POST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/compatible-mode/v1/chat/completionsbase_url para chamadas de SDK: https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/compatible-mode/v1Substitua {WorkspaceId} pelo seu workspace ID real.Substitua {WorkspaceId} pelo seu workspace ID real.Corpo da requisição |
|
modelstring(Obrigatório)Nome do model. Este parâmetro aplica-se apenas ao modelo Qwen3-ASR-Flash. | |
messagesarray(Obrigatório)Lista de mensagens.
Tipos de mensagem System Message object (Opcional)Utilizada para fornecer contexto ao reconhecimento de fala, como texto de fundo e glossários de entidades. Não suporta a definição de função do modelo ou outros prompts tradicionais de sistema. Caso utilize uma system message, ela deve ser a primeira mensagem na lista messages.
Propriedades role string(Obrigatório)Defina como system.object(Obrigatório)Mensagem enviada pelo usuário ao modelo.
Propriedades content array(Obrigatório)Conteúdo da mensagem do usuário. Apenas uma mensagem é permitida no array.
Propriedades type string(Obrigatório)Defina como input_audio, indicando que a entrada é um áudio.input_audiostring(Obrigatório)Áudio a ser reconhecido. Para mais detalhes sobre como usar este parâmetro, consulte Quick start.No modo compatível com OpenAI, o modelo Qwen3-ASR-Flash aceita dois formatos de entrada: arquivos codificados em Base64 e URLs de arquivos de áudio acessíveis pela rede pública.Ao utilizar um SDK, se o arquivo de áudio estiver armazenado no OSS, URLs temporárias iniciadas com oss:// não são suportadas.Ao utilizar uma API RESTful, se o arquivo de áudio estiver armazenado no OSS, URLs temporárias iniciadas com oss:// são suportadas. Observação:string(Obrigatório)Função da mensagem do usuário. Defina como user. | |
asr_optionsobject(Opcional)Define se determinados recursos devem ser ativados.
Propriedades language string (Opcional) Sem valor padrãoCaso o idioma do áudio seja conhecido, especifique-o neste parâmetro para melhorar a precisão do reconhecimento.É possível especificar apenas um idioma.Se o idioma do áudio for incerto ou incluir múltiplos idiomas (como uma mistura de chinês, inglês, japonês e coreano), não defina este parâmetro.
Valores válidos
boolean (Opcional) Padrão: falseDefine se a Normalização Inversa de Texto (ITN) deve ser ativada. Este recurso aplica-se apenas a áudios em chinês e inglês.
| |
streamboolean(Opcional) Padrão: falseDefine se a saída em streaming deve ser utilizada. Consulte Streaming output.Valores válidos:
true para reduzir o risco de timeout nas requisições. | |
stream_optionsobject(Opcional)Itens de configuração para saída em streaming. Este parâmetro só tem efeito quando stream estiver definido como true.
Propriedades include_usage boolean(Opcional) Padrão: falseDefine se as informações de consumo de tokens devem ser incluídas no último bloco de dados da resposta.Valores válidos:
Durante a saída em streaming, as informações de consumo de tokens aparecem apenas no último bloco de dados da resposta. |
Corpo da resposta | |
idstringIdentificador único desta chamada. | |
choicesarrayInformações de saída do modelo.
Propriedades finish_reason stringValores válidos:
integerÍndice do objeto atual no array choices.messageobjectObjeto de mensagem gerado pelo modelo.
Propriedades role stringFunção da mensagem de saída. Definida como assistant.contentarrayResultado do reconhecimento de fala.annotationsarrayInformações de anotação da saída, como o idioma.
Propriedades language stringIdioma do áudio reconhecido. Se o parâmetro de requisição language for especificado, este valor será igual ao parâmetro definido.
Valores válidos
stringDefinido como audio_info, indicando informações de áudio.emotionstringEmoção detectada no áudio reconhecido. As seguintes emoções são suportadas:
| |
createdintegerTimestamp UNIX (em segundos) de criação da requisição. | |
modelstringModelo utilizado nesta requisição. | |
objectstringSempre chat.completion. | |
usageobjectInformações de consumo de tokens desta requisição.
Propriedades completion_tokens integerQuantidade de tokens na saída do modelo.completion_tokens_details objectDetalhes granulares dos tokens na saída do modelo.
Propriedades text_tokens integerQuantidade de tokens no texto de saída do modelo.objectQuantidade de tokens na entrada.prompt_tokens_details objectDetalhes granulares dos tokens na entrada.
Propriedades audio_tokens integerDuração do áudio de entrada em tokens. Regra de conversão de áudio para token: Cada segundo de áudio é convertido em 25 tokens. Durações inferiores a 1 segundo são contabilizadas como 1 segundo.text_tokens integerEste parâmetro pode ser ignorado.integerDuração do áudio em segundos.total_tokens integerNúmero total de tokens de entrada e saída (total_tokens = completion_tokens + prompt_tokens). |
DashScope síncrono
URL
- Singapore
- US (Virginia)
- China (Beijing)
POST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generationbase_url para chamadas via SDK: https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1Substitua {WorkspaceId} pelo seu workspace ID real.Substitua {WorkspaceId} pelo seu workspace ID real.Request body | O exemplo a seguir mostra como reconhecer um arquivo de áudio a partir de uma URL. Para ver um exemplo de reconhecimento de arquivo de áudio local, consulte Quick start. |
modelstring(Required)Nome do model. Este parâmetro aplica-se apenas ao modelo Qwen3-ASR-Flash. | |
messagesarray(Required)Lista de mensagens.Ao fazer uma chamada HTTP, coloque messages dentro do objeto input.
Tipos de mensagem Mensagem do sistema object (Optional)Fornece contexto para o reconhecimento de fala, como texto de fundo e glossários de entidades. Não suporta a definição de função do modelo ou outros prompts tradicionais de sistema. Se definir uma mensagem de sistema, coloque-a no início da lista de mensagens.Apenas o Qwen3-ASR-Flash suporta este parâmetro.
Propriedades role string(Required)Defina como system.object(Required)Mensagem enviada pelo usuário ao modelo.
Propriedades content array(Required)Conteúdo da mensagem do usuário. Apenas uma mensagem é permitida no array.
Propriedades audio string(Required)Áudio a ser reconhecido. Para mais informações sobre como usar este parâmetro, consulte Quick start.Ao usar o DashScope, o modelo Qwen3-ASR-Flash suporta três formatos de entrada: arquivos codificados em Base64, caminhos absolutos de arquivos locais e URLs de arquivos de áudio acessíveis pela rede pública.Ao usar um SDK, se o arquivo de áudio estiver armazenado no OSS, URLs temporárias que começam com oss:// não são suportadas.Ao usar uma API RESTful, se o arquivo de áudio estiver armazenado no OSS, URLs temporárias que começam com oss:// são suportadas. Observação:string(Required)Função da mensagem do usuário. Defina como user. | |
asr_optionsobject(Optional)Define se determinados recursos devem ser ativados.Este parâmetro é suportado apenas pelo modelo Qwen3-ASR-Flash.
Propriedades language string (Optional) Sem valor padrãoCaso o idioma do áudio seja conhecido, especifique-o neste parâmetro para melhorar a precisão do reconhecimento.É possível especificar apenas um idioma.Se o idioma do áudio for incerto ou incluir múltiplos idiomas (como uma mistura de chinês, inglês, japonês e coreano), não especifique este parâmetro.
Valores válidos
boolean (Optional) Padrão: falseDefine se a Normalização Inversa de Texto (ITN) deve ser ativada. Este recurso aplica-se apenas a áudios em chinês e inglês.
|
Response body | |
request_idstringIdentificador único desta chamada.O parâmetro retornado pelo SDK Java é requestId | |
outputobjectInformações do resultado da chamada.
Propriedades choices arraySaída do modelo. Retornado quando result_format é message.
Propriedades finish_reason stringValores válidos:
objectObjeto de mensagem gerado pelo modelo.
Propriedades role stringFunção da mensagem de saída. Definida como assistant.contentarrayConteúdo da mensagem de saída.
Propriedades text stringResultado do reconhecimento de fala.arrayInformações de anotação da saída, como o idioma.
Propriedades language stringIdioma do áudio reconhecido. Se o parâmetro de requisição language for especificado, este valor será igual ao parâmetro definido.
Valores válidos
stringDefinido como audio_info, indicando informações de áudio.emotionstringEmoção detectada no áudio reconhecido. As seguintes emoções são suportadas:
| |
usageobjectInformações sobre o consumo de tokens nesta requisição.
Propriedades input_tokens_details objectComprimento do conteúdo de entrada para o Qwen3-ASR-Flash em tokens.
Propriedades text_tokens integerVocê pode ignorar este parâmetro.objectComprimento do conteúdo de saída do Qwen3-ASR-Flash em tokens.
Propriedades text_tokens integerComprimento do texto reconhecido gerado pelo Qwen3-ASR-Flash em tokens.integerDuração do áudio processado pelo Qwen3-ASR-Flash em segundos. |
Invocação assíncrona do DashScope
Descrição do processo
A invocação assíncrona foi projetada para arquivos de áudio longos ou tarefas que demandam muito tempo. Ela utiliza um processo de duas etapas, "enviar-consultar", para evitar timeouts nas requisições:
-
Etapa 1: Enviar uma tarefa
- O cliente inicia uma requisição de processamento assíncrono.
- Após validar a requisição, o servidor não executa a tarefa imediatamente. Em vez disso, ele retorna um
task_idúnico, indicando que a tarefa foi criada com sucesso.
-
Etapa 2: Obter o resultado
- O cliente usa o
task_idpara consultar a API de resultados periodicamente. - Quando a tarefa é concluída, a API de resultados retorna o resultado final do reconhecimento.
- O cliente usa o
-
Use um SDK. Para exemplos de código, consulte QuickStart. Para parâmetros de requisição, veja a Request body da operação Submit a task. Para informações sobre a resposta, consulte Description of asynchronous call results.
Os SDKs gerenciam automaticamente os detalhes subjacentes das chamadas de API.
- Envie uma tarefa: Chame o método
async_call()(Python) ouasyncCall()(Java) para enviar a tarefa. Este método retorna um objeto de tarefa contendo umtask_id. - Obtenha o resultado: Use o objeto de tarefa retornado na etapa anterior ou o
task_idpara chamar o métodofetch()e recuperar o resultado. O SDK lida automaticamente com a lógica interna de consulta até que a tarefa seja concluída ou atinja o timeout.
- Envie uma tarefa: Chame o método
-
Use uma API RESTful
Chamar a API RESTful diretamente oferece máxima flexibilidade.
- Submit the task. Se a requisição for bem-sucedida, a response body conterá um
task_id. - Utilize o
task_idda etapa anterior para retrieve the task execution result.
- Submit the task. Se a requisição for bem-sucedida, a response body conterá um
Enviar uma tarefa
URL
- Singapore
- China (Beijing)
POST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/audio/asr/transcriptionbase_url para chamadas de SDK: https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1Substitua {WorkspaceId} pelo seu workspace ID real.Substitua {WorkspaceId} pelo seu workspace ID real.Request body |
|
modelstring(Required)Nome do model. Este parâmetro aplica-se apenas ao modelo Qwen3-ASR-Flash-Filetrans. | |
inputobject(Required)
Properties file_url string(Required)URL do arquivo de áudio a ser reconhecido. A URL deve ser acessível pela rede pública.Ao usar um SDK, se o arquivo de áudio estiver armazenado no OSS, URLs temporárias que começam com oss:// não são suportadas.Ao usar uma API RESTful, se o arquivo de áudio estiver armazenado no OSS, URLs temporárias que começam com oss:// são suportadas. Observação: | |
parametersobject(Optional)
Properties language string (Optional) Sem valor padrãoSe o idioma do áudio for conhecido, especifique-o usando este parâmetro para melhorar a precisão do reconhecimento.É possível especificar apenas um idioma.Caso o idioma do áudio seja incerto ou inclua múltiplos idiomas (como uma mistura de chinês, inglês, japonês e coreano), não especifique este parâmetro.
Valid values
boolean (Optional) Padrão: falseDefine se a Normalização Inversa de Texto (ITN) deve ser ativada. Este recurso aplica-se apenas a áudios em chinês e inglês.
boolean(Optional) Padrão: falseDefine se timestamps no nível de palavra devem ser retornados:
array(Optional) Padrão: [0]Especifica os índices das faixas de áudio a serem reconhecidas em um arquivo de áudio com múltiplas faixas. O índice começa em 0. Por exemplo, [0] indica que a primeira faixa de áudio será reconhecida, e [0, 1] indica que a primeira e a segunda faixas serão reconhecidas simultaneamente. Se este parâmetro for omitido, a primeira faixa de áudio será processada por padrão. |
Response body | |
request_idstringIdentificador único para esta chamada. | |
outputobjectInformações sobre o resultado da chamada.
Properties task_id stringID da tarefa. Este ID é passado como parâmetro de requisição na API para consultar tarefas de reconhecimento de fala.task_statusstringStatus da tarefa:
|
Obter o resultado da execução da tarefa
URL
- Singapore
- China (Beijing)
GET https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/tasks/{task_id}base_url para chamadas de SDK: https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1Substitua {WorkspaceId} pelo seu workspace ID real.Substitua {WorkspaceId} pelo seu workspace ID real.Request body |
|
task_idstring(Required)ID da tarefa. Passe o task_id da resposta da operação Submit a task para consultar o resultado do reconhecimento de fala. |
Response body | |
request_idstringIdentificador único desta chamada. | |
outputobjectInformações sobre o resultado da chamada.
Properties task_id stringID da tarefa. Este ID é passado como parâmetro de requisição na API para consulta de tarefas de reconhecimento de fala.task_statusstringStatus da tarefa:
objectResultado do reconhecimento de fala.
Properties transcription_url stringURL de download do arquivo de resultado do reconhecimento. O link é válido por 24 horas. Após a expiração, não será possível consultar a tarefa ou baixar o resultado usando a URL anterior.O resultado do reconhecimento é salvo como um arquivo JSON. Baixe o arquivo através deste link ou leia o conteúdo diretamente via requisição HTTP. Para mais informações, consulte Description of asynchronous call results. stringHorário em que a tarefa foi enviada.schedule_timestringHorário em que a tarefa foi agendada, correspondendo ao início da execução.end_timestringHorário de término da tarefa.task_metricsobjectMétricas da tarefa, incluindo estatísticas sobre o status das subtarefas.
Properties TOTAL integerNúmero total de subtarefas.SUCCEEDEDintegerQuantidade de subtarefas concluídas com sucesso.FAILEDintegerQuantidade de subtarefas que falharam.stringCódigo de erro. Retornado apenas quando a tarefa falha.messagestringMensagem de erro. Retornada apenas quando a tarefa falha.usageobjectInformações sobre o consumo de tokens nesta requisição.
Properties seconds integerDuração do áudio para Qwen3-ASR-Flash em segundos. |
Descrição dos resultados de chamada assíncrona | |
file_url stringURL do arquivo de áudio reconhecido. | |
audio_infoobjectInformações sobre o arquivo de áudio reconhecido.
Properties format stringFormato do áudio.sample_rate integerTaxa de amostragem do áudio. | |
transcriptsarrayLista completa dos resultados de reconhecimento. Cada elemento corresponde ao conteúdo reconhecido de uma faixa de áudio.
Properties channel_id integerÍndice da faixa de áudio, iniciando em 0.textstringTexto reconhecido.sentencesobjectLista de resultados de reconhecimento no nível de sentença.
Properties begin_time integerTimestamp inicial da sentença em milissegundos.end_time integerTimestamp final da sentença em milissegundos.textstringTexto reconhecido.sentence_idintegerÍndice da sentença, iniciando em 0.languagestringIdioma do áudio reconhecido. Se o parâmetro de requisição language for especificado, este valor será igual ao parâmetro definido.
Valid values
stringEmoção detectada no áudio reconhecido. As seguintes emoções são suportadas:
objectLista de resultados de reconhecimento no nível de palavra. Este resultado é exibido quando o parâmetro de requisição enable_words está definido como true.
Properties begin_time integerTimestamp inicial em milissegundos.end_time integerTimestamp final em milissegundos.textstringTexto reconhecido.punctuationstringSinal de pontuação. |