O reconhecimento de fala do Model Studio oferece três formas de aumentar a precisão no reconhecimento de termos especializados, nomes de product e outros vocabulários específicos de domínio: hotwords pré-compiladas, hotwords instantâneas e aprimoramento de contexto. Este tópico descreve o escopo e o uso de cada abordagem.
Visão geral
Alguns termos de negócios, como nomes de product, substantivos próprios e jargões do setor, estão ausentes do vocabulário geral do modelo e, por isso, têm menor precisão no reconhecimento. O reconhecimento de fala do Model Studio fornece três maneiras de melhorar o reconhecimento desses termos: hotwords pré-compiladas, hotwords instantâneas e aprimoramento de contexto.
Hotwords pré-compiladas vs. hotwords instantâneas vs. aprimoramento de contexto
As hotwords personalizadas existem em duas formas: pré-compiladas e instantâneas. A tabela a seguir compara as três abordagens, aplicáveis a diferentes modelos e API:
Dimensão | Hotwords pré-compiladas | Hotwords instantâneas | Aprimoramento de contexto |
|---|---|---|---|
Funcionamento | Crie um vocabulário ponderado antecipadamente. O modelo aumenta a probabilidade de correspondência dessas palavras durante a decodificação. | Passe hotwords ponderadas diretamente na requisição. O modelo eleva a probabilidade de correspondência delas durante a decodificação. | Forneça o histórico da conversa ou texto de domínio. O modelo utiliza esse contexto para corrigir os resultados do reconhecimento. |
Modelos suportados | Consulte Supported models and regions. | Consulte Supported models and regions. | Consulte Supported models and regions. |
Quando usar | O vocabulário é conhecido e relativamente estável, e você precisa reutilizar a mesma lista de palavras em várias requisições (por exemplo, nomes de product ou termos médicos). | Hotwords temporárias, no nível da sessão, que não precisam ser reutilizadas entre requisições (por exemplo, o nome de uma pessoa ou um termo ad hoc usado em uma única sessão). | O vocabulário muda dinamicamente durante uma conversa, ou você precisa de contexto para ajudar o modelo a entender substantivos próprios (por exemplo, participantes em atas de reunião ou termos de negócios em conversas de atendimento ao cliente). |
Como configure | Crie uma lista de hotwords antecipadamente e passe o ID da lista ao fazer a chamada. | Passe pares chave-valor | Envie o histórico da conversa ou texto de domínio com cada requisição. Para reconhecimento não em tempo real, use |
Pré-requisitos
- Obtain an API key e configured as an environment variable.
- Para chamar o service por meio do DashScope SDK, install the latest SDK.
Hotwords pré-compiladas
Crie uma lista de hotwords antecipadamente, obtenha o ID dessa lista e passe-o durante o reconhecimento. Essa abordagem é adequada para cenários em que o vocabulário é conhecido e relativamente estável, e você precisa reutilizar a mesma lista de palavras em várias requisições, como nomes de product ou termos médicos.
Modelos e regiões suportados
- Singapore
- China (Beijing)
-
Reconhecimento de fala em tempo real:
- Qwen-Audio-3.0-ASR-Flash-Streaming: qwen-audio-3.0-asr-flash-streaming
- Fun-ASR-Realtime: fun-asr-realtime, fun-asr-realtime-2025-11-07
-
Reconhecimento de fala não em tempo real:
- Qwen-Audio-3.0-ASR-Flash-Filetrans: qwen-audio-3.0-asr-flash-filetrans
- Qwen-Audio-3.0-ASR-Flash: qwen-audio-3.0-asr-flash
- Fun-ASR-Flash: fun-asr-flash-2026-06-15
- Fun-ASR: fun-asr, fun-asr-2025-11-07, fun-asr-2025-08-25, fun-asr-mtl, fun-asr-mtl-2025-08-25
Início rápido
Fluxo de trabalho
Primeiro crie uma lista de hotwords e depois referencie o ID dela durante o reconhecimento de fala:
- Crie uma lista de hotwords. Chame a API create-hotword-list. Especifique target_model (targetModel em Java) para indicar a qual modelo de reconhecimento de fala a lista pertence. Se você já tiver uma lista de hotwords (verificável por meio da API list-all-hotword-lists), pule esta etapa.
- Chame a API de reconhecimento de fala e passe o ID da lista de hotwords. O modelo usado para reconhecimento deve corresponder ao target_model (targetModel em Java) especificado na criação da lista. Caso contrário, as hotwords não terão efeito.
Código de exemplo
Exemplo de ponta a ponta: crie uma lista de hotwords, execute o reconhecimento de fala e exclua a lista.
Formato das hotwords
Envie as hotwords como um array JSON, em que cada elemento define uma única hotword e seus atributos.
Exemplo: Melhorar a precisão do reconhecimento de títulos de filmes.
Campo | Tipo | Obrigatório | Descrição |
|---|---|---|---|
text | string | Sim | O texto da hotword. Deve ser uma palavra real, e não uma sequência arbitrária de caracteres, e seu idioma deve estar dentro do intervalo suportado pelo modelo selecionado. Para limites de comprimento, consulte Hotword text rules. |
weight | int | Sim | O peso da hotword. Valores válidos: [1, 5]. Recomendado: 4. Um peso maior torna mais provável que o modelo produza a palavra. As séries de modelos Qwen-Audio-3.0-ASR-Flash-Streaming, Qwen-Audio-3.0-ASR-Flash-Filetrans e Qwen-Audio-3.0-ASR-Flash também suportam |
lang | string | Não | O código de idioma que limita o idioma ao qual a hotword se aplica. Pode ser omitido quando o idioma for desconhecido. Nota: |
Hotwords instantâneas
As hotwords instantâneas são passadas como pares chave-valor vocabulary diretamente na requisição de reconhecimento. Elas funcionam essencialmente como um conjunto de hotwords ponderadas, idêntico à lista de palavras usada pelas hotwords pré-compiladas, exceto pelo fato de serem enviadas diretamente na requisição, sem necessidade de uma lista pré-criada. Isso é ideal para ajustes temporários de hotwords no nível da sessão.
Modelos e regiões suportados
- Singapore
- China (Beijing)
-
Reconhecimento de fala em tempo real:
- Qwen-Audio-3.0-ASR-Flash-Streaming: qwen-audio-3.0-asr-flash-streaming
-
Reconhecimento de fala não em tempo real:
- Qwen-Audio-3.0-ASR-Flash-Filetrans: qwen-audio-3.0-asr-flash-filetrans
- Qwen-Audio-3.0-ASR-Flash: qwen-audio-3.0-asr-flash
Início rápido
Passe vocabulary nos parameters da requisição de reconhecimento. Nenhuma lista de hotwords é necessária. Para uso detalhado de cada API, consulte a referência da API em Speech-to-text.
Exemplo (reconhecimento de fala não em tempo real):
Formato das hotwords
Envie as hotwords instantâneas como um objeto JSON (pares chave-valor): a chave é o texto da hotword (string) e o valor é o peso da hotword (integer). Para regras de texto das hotwords, consulte Hotword text rules.
Exemplo:
Ajuste e regras de hotwords
As seguintes regras de texto e dicas de ajuste de hotwords aplicam-se tanto a hotwords pré-compiladas quanto a instantâneas.
Regras de texto das hotwords
Uma hotword deve ser uma palavra real. Aplicam-se os seguintes limites de comprimento:
-
Com caracteres não ASCII: A contagem total de caracteres (a soma de caracteres não ASCII, como caracteres chineses, kana japonês, hangul coreano e letras cirílicas, mais quaisquer caracteres ASCII) não deve exceder 15.
Exemplos:
- ✅
"厄洛替尼盐酸盐"(7 caracteres) - ✅
"EGFR抑制剂"(7 caracteres, onde EGFR conta como 4 caracteres ASCII) - ✅
"こんにちは"(5 caracteres) - ✅
"Фенибут Белфарм"(15 caracteres, incluindo o espaço no meio) - ❌
"Клофелин Белмедпрепараты"(24 caracteres)
- ✅
-
Apenas com caracteres ASCII: Após dividir por espaços, o número de segmentos não deve exceder 7.
Exemplos:
- ✅
"Exothermic reaction"→ 2 segmentos - ✅
"Human immunodeficiency virus type 1"→ 5 segmentos - ❌
"The effect of temperature variations on enzyme activity in biochemical reactions"→ 11 segmentos
- ✅
Ajustar pesos das hotwords
O peso controla a intensidade com que o modelo prefere uma hotword. Defini-lo adequadamente melhora a precisão do reconhecimento das palavras-alvo, evitando erros de reconhecimento.
Peso | Efeito | Quando usar |
|---|---|---|
1–2 | Preferência leve | A hotword tem som semelhante a uma palavra comum, e você precisa evitar correções excessivas. |
3–4 | Preferência clara (recomendado) | O melhor valor inicial para a maioria dos cenários. |
5 | Preferência forçada | A palavra aparece frequentemente no áudio e dificilmente será confundida com outras. Um peso muito alto pode fazer com que palavras de sonoridade similar sejam reconhecidas incorretamente como a hotword. |
weight=4 e ajuste conforme os resultados.
Super hotwords (weight=50): Tanto hotwords pré-compiladas quanto instantâneas suportam super hotwords, mas apenas as séries de modelos Qwen-Audio-3.0-ASR-Flash-Streaming, Qwen-Audio-3.0-ASR-Flash-Filetrans e Qwen-Audio-3.0-ASR-Flash oferecem esse recurso. Um peso de 50 melhora significativamente o recall. Você pode ter no máximo 50 super hotwords.
Recomendações de design
- Agrupe por cenário: Organize as hotwords separadamente para diferentes cenários de negócios (por exemplo, um grupo para termos médicos e outro para nomes de product) para simplificar a manutenção e a reutilização. Para hotwords pré-compiladas, crie uma lista distinta para cada cenário.
- Misture idiomas (hotwords pré-compiladas): Uma única lista de hotwords pode conter termos em diferentes idiomas, diferenciados pelo campo
lang. Ao especifiquelanguage_hintsdurante o reconhecimento, apenas as hotwords naquele idioma entrarão em vigor. - Faça limpezas regulares (hotwords pré-compiladas): Exclua listas de hotwords que não são mais usadas para liberar sua cota (até 10 por conta).
Limites e faturamento de hotwords
Limite | Descrição |
|---|---|
Número de listas de hotwords (hotwords pré-compiladas) | Uma lista de hotwords é uma lista persistente de palavras criada antecipadamente para hotwords pré-compiladas (cada lista corresponde a um vocabulary_id). Você pode ter até 10 listas por conta, compartilhadas entre todos os modelos. |
Número máximo de hotwords (hotwords pré-compiladas / instantâneas) | O número máximo de hotwords depende do modelo usado para reconhecimento:
Para hotwords pré-compiladas, a contagem é por lista de hotwords. Para hotwords instantâneas, a contagem é por requisição. |
Número de super hotwords (hotwords pré-compiladas / instantâneas) | Você pode ter até 50 super hotwords (peso 50). |
Faturamento | Tanto hotwords pré-compiladas quanto instantâneas são gratuitas. |
Aprimoramento de contexto
Modelos e regiões suportados
- Singapore
- China (Beijing)
-
Reconhecimento de fala em tempo real:
- Qwen-Audio-3.0-ASR-Flash-Streaming: qwen-audio-3.0-asr-flash-streaming
- Fun-ASR-Realtime: fun-asr-realtime, fun-asr-realtime-2025-11-07
-
Reconhecimento de fala não em tempo real:
- Qwen-Audio-3.0-ASR-Flash-Filetrans: qwen-audio-3.0-asr-flash-filetrans
- Qwen-Audio-3.0-ASR-Flash: qwen-audio-3.0-asr-flash
- Fun-ASR-Flash: fun-asr-flash-2026-06-15
Início rápido
O aprimoramento de contexto não exige recursos pré-criados. Passe os parâmetros de contexto diretamente na requisição de reconhecimento:
- Reconhecimento de fala não em tempo real: Passe mensagens de contexto em
input.messagesda requisição http, posicionadas antes da mensagem de áudio. - Reconhecimento de fala em tempo real: Passe mensagens de contexto em
input.contextdo evento WebSocketrun-task. Para atualize o contexto enquanto a tarefa está em execução, envie um eventocontinue-task. O DashScope SDK encapsula esse protocolo, permitindo que você passe o contexto diretamente por meio de um parâmetro.
- Reconhecimento de fala não em tempo real
- Reconhecimento de fala em tempo real
input.messages. A função user com o tipo input_text transmite os resultados de reconhecimento de turnos anteriores ou uma lista de palavras relacionadas ao domínio, e a função assistant passa as respostas do modelo de turnos anteriores (opcional). Posicione as mensagens de contexto antes da mensagem de áudio. Para detalhes, consulte Non-real-time speech recognition (Qwen-Audio-3.0-ASR-Flash/Fun-ASR-Flash).Transmita os resultados de reconhecimento de turnos anteriores (user / input_text) e as respostas do modelo (assistant / text). Para passar apenas termos de domínio ou uma lista de palavras, omita o histórico da conversa (as mensagens assistant).Exemplo
O campo text do contexto aceita um formato flexível — uma lista de palavras, um parágrafo em linguagem natural ou uma combinação de ambos — e é altamente tolerante a textos irrelevantes.
O resultado correto de reconhecimento para um trecho de áudio deveria ser "How many of the insider jargon terms in the investment banking world do you know? First, the nine major foreign investment banks—Bulge Bracket, BB ...".
Sem aprimoramento de contexto Sem o aprimoramento de contexto, alguns nomes de bancos de investimento são reconhecidos incorretamente. Por exemplo, "Bird Rock" deveria ser "Bulge Bracket". Resultado do reconhecimento: "How many of the insider jargon terms in the investment banking world do you know? First, the nine major foreign investment banks—Bird Rock, BB ..." | Com aprimoramento de contexto Com o aprimoramento de contexto, os nomes dos bancos de investimento são reconhecidos corretamente. Resultado do reconhecimento: "How many of the insider jargon terms in the investment banking world do you know? First, the nine major foreign investment banks—Bulge Bracket, BB ..." |
text do contexto.
Referência da API
- Precompiled hotword API reference
- Real-time speech recognition - Qwen-Audio-ASR-Streaming/Fun-ASR-Realtime API reference
- Real-time speech recognition - Qwen-ASR API reference
- Real-time speech recognition - Paraformer API reference
- Non-real-time speech recognition - Qwen-Audio-ASR-Filetrans/Fun-ASR API reference
- Non-real-time speech recognition - Qwen-Audio-ASR/Fun-ASR-Flash API reference
- Non-real-time speech recognition - Qwen-ASR API reference
- Non-real-time speech recognition - Paraformer API reference
FAQ
P: O reconhecimento não melhora após defina hotwords?
Verifique os itens a seguir nesta ordem:
- Correspondência de modelo (hotwords pré-compiladas): O
target_modelespecificado na criação da lista de hotwords deve corresponder ao modelo usado pela API de reconhecimento de fala. Quando não há correspondência, a API não retorna erro e o reconhecimento ainda produz resultados, mas as hotwords não têm efeito. Se os resultados não incluírem as hotwords esperadas, verifique este item primeiro. - Suporte do modelo
- Peso: Aumente o peso de 4 para 5 e observe o efeito. Se palavras com sonoridade semelhante forem reconhecidas incorretamente como a hotword, reverta para 4.
- Status da lista de hotwords (hotwords pré-compiladas): Use a API de consulta para confirme se o
statuséOK.
P: As hotwords pré-compiladas são usadas da mesma forma no reconhecimento de fala em tempo real e não em tempo real?
Elas são criadas da mesma maneira, mas chamadas de forma diferente:
- Reconhecimento de fala em tempo real: Passe
vocabulary_idnos parâmetros de conexão do Recognition ou WebSocket. - Transcrição de arquivos de áudio: Passe
vocabulary_idnos parâmetros da requisição de Transcription.
target_model deve corresponder ao modelo de reconhecimento de fala realmente chamado. Hotwords instantâneas não exigem lista nem target_model; basta passar pares chave-valor vocabulary nos parâmetros da requisição. Para as séries de modelos Qwen-Audio-3.0-ASR-Flash-Streaming, Qwen-Audio-3.0-ASR-Flash-Filetrans e Qwen-Audio-3.0-ASR-Flash, que suportam hotwords instantâneas, o sistema mescla hotwords pré-compiladas e instantâneas quando ambas estão configuradas. Se o conjunto mesclado contiver mais de 2.000 hotwords, o sistema selecionará aleatoriamente 2.000 para uso.
P: Além de hotwords e aprimoramento de contexto, quais outras formas podem melhorar a precisão do reconhecimento?
Você também pode otimizar das seguintes maneiras:
- Qualidade do áudio: Alinhe a taxa de amostragem à exigência do modelo (16 kHz ou 8 kHz) e reduza o ruído de fundo.
- Escolha o modelo certo: Diferentes cenários exigem modelos diferentes. Para detalhes, consulte o guia de seleção Speech-to-text.
- Especifique o idioma: Declare o idioma do áudio por meio de
language_hintspara melhorar a precisão em cenários de idioma único.