O Fun-Music gera músicas completas com vocais masculinos ou femininos em chinês ou inglês a partir de um prompt de texto que descreve o estilo musical e a cena, ou a partir de letras personalizadas. O modelo também suporta geração de música instrumental.
Visão geral
O Fun-Music é um modelo de geração de música ponta a ponta. Forneça uma descrição em linguagem natural ou letras personalizadas para receber uma música completa :
prompt: Descreva o estilo musical, a cena, o clima e as preferências de instrumentos. O modelo escreve a letra e gera a música automaticamente.lyrics: Forneça letras personalizadas. O modelo compõe e executa uma música com base no seu texto.gender: Selecione vocais masculinos ou femininos (apenas fun-music-v1).- Saída em streaming e sem streaming
- Saída de áudio nos formatos MP3 e WAV
Diferenças entre os dois modelos
O Fun-Music oferece dois modelos com as seguintes diferenças:
Recurso | fun-music-v1 | fun-music-preview |
|---|---|---|
prompt | Obrigatório (pelo menos um entre | Obrigatório |
lyrics | Opcional se | Opcional; se fornecido, |
Gênero vocal (gender) | Compatível | Não compatível |
Formatos de saída de áudio
Defina o parâmetro format para especificar o formato de saída:
Formato | Características | Casos de uso |
|---|---|---|
| Compressão com perdas, tamanho de arquivo reduzido | Streaming, reprodução online, armazenamento |
| Formato sem perdas, tamanho de arquivo maior | Pós-produção, reprodução de alta qualidade |
Pré-requisitos
- Uma chave de API. Para mais informações, consulte Obter uma chave de API.
- Chave de API configurada como variável de ambiente (recomendado):
{WorkspaceId} no código de exemplo pelo ID real do seu workspace. Para mais informações, consulte Gerenciamento de workspaces.Início rápido
Os exemplos a seguir demonstram três casos de uso típicos.
- Gerar uma música a partir de um prompt
- Gerar uma música a partir de letras
prompt com uma descrição do estilo musical e da cena. O modelo escreverá a letra e comporá a música.Guia de composição
Prompt
O parâmetro prompt é o principal meio para descrever sua intenção de criação musical. O modelo escreve a letra, faz os arranjos e gera a música com base na sua descrição.
Dica de escrita: Utilize descrições específicas de clima, cena e preferências de instrumentos para obter melhores resultados.
- Recomendado:
Melancholic piano, rainy night yearning - Não recomendado:
Melancholic music(muito vago)
Estilo | Exemplo de prompt |
|---|---|
Folk | Uma música folk acolhedora e curativa com violão acústico, contando a história de uma tarde preguiçosa em um café |
Chinês tradicional | Uma canção tradicional chinesa com guzheng e flauta de bambu, evocando paisagens enevoadas e uma despedida entre viajantes |
Rock | Rock intenso com guitarra elétrica distorcida e batidas densas de bateria, cantando sobre rebeldia juvenil e liberdade |
Balada | Uma balada lenta com acompanhamento de piano, silenciosa e profunda, com um toque de melancolia, expressando saudade e memórias |
Rap | Um rap hip-hop com batida marcante e bumbos 808, cheio de energia urbana, contando histórias da vida na cidade |
Canção infantil | Uma canção infantil alegre com xilofone e tambores manuais, ritmo simples e cativante, ensinando as crianças sobre a natureza |
Letras
O parâmetro lyrics aceita suas letras. O modelo compõe uma música que as segue de perto. Use tags de seção para controlar o arranjo das partes da música.
Tags de seção musical
Tag | Descrição |
|---|---|
| Introdução, define o clima |
| Verso, conta a história |
| Refrão, clímax emocional |
| Ponte, muda a perspectiva |
| Finalização, desvanecimento gradual |
- Originalidade: Não copie nem imite letras, esquemas de rimas ou frases características de músicas publicadas.
- Segurança do conteúdo: Não inclua conteúdo relacionado a política, violência, pornografia, vulgaridade, terror ou drogas. Mantenha o conteúdo positivo e emocionalmente genuíno.
- Idioma: Apenas letras em chinês e inglês são compatíveis. Japonês, coreano e outros idiomas não são aceitos.
Gênero vocal (gender)
O parâmetro gender seleciona o gênero do vocal. Compatível apenas com o modelo fun-music-v1. O padrão é female.
female: Vocais femininos (padrão)male: Vocais masculinos
Recursos avançados
Saída em streaming
O modo de streaming retorna dados de áudio progressivamente à medida que são gerados, sendo ideal para reprodução em tempo real. Tanto o fun-music-v1 quanto o fun-music-preview suportam esse modo. Para ativar a saída em streaming, adicione X-DashScope-SSE: enable ao cabeçalho da requisição.
- Modo sem streaming:
lyricsaceita de 5 a 350 caracteres chineses ou de 5 a 2.000 caracteres em inglês;promptaceita de 1 a 2.000 caracteres. - Modo de streaming:
lyricsaceita de 300 a 350 caracteres chineses ou de 200 a 250 palavras em inglês;promptaceita de 5 a 1.000 caracteres (chinês ou inglês).
Modelos e regiões compatíveis
China (Pequim)
Para chamar os modelos a seguir, utilize uma chave de API da região de Pequim:
- fun-music-v1
- fun-music-preview
- China (Pequim)
- fun-music-v1
- fun-music-preview
Referência da API
Referência da API de geração de música
Perguntas frequentes
Posso especificar instrumentos, andamento ou clima?
Sim. Descreva-os diretamente no seu prompt, como "piano accompaniment, slow tempo, melancholic". O modelo segue essas descrições da forma mais fiel possível. Prompts mais específicos produzem resultados mais precisos. Para dicas detalhadas de escrita de prompts, consulte Prompt.
Qual modelo devo escolher?
O fun-music-v1 permite seleção de gênero vocal e gera áudio de maior qualidade. Já o fun-music-preview aceita letras personalizadas e geração baseada em prompt. Para uma comparação detalhada, consulte Diferenças entre os dois modelos.
Por quanto tempo as URLs de download de áudio são válidas?
As URLs de download dos arquivos de áudio têm validade de 24 horas. Baixe os arquivos dentro desse período. Após a expiração da URL, chame a API novamente para gerar uma nova.
Qual a diferença entre lyrics e prompt?
O parâmetro lyrics recebe suas letras, e o modelo compõe uma música com base nelas. O parâmetro prompt recebe uma descrição em linguagem natural do estilo musical e da cena, fazendo com que o modelo escreva a letra e gere a música automaticamente. Os requisitos dos parâmetros variam conforme o modelo: para o fun-music-v1, pelo menos um dos dois parâmetros é obrigatório; se ambos forem fornecidos, lyrics prevalece. Para o fun-music-preview, o prompt é obrigatório; o lyrics é opcional e tem prioridade sobre o prompt quando fornecido.
Quando devo usar o modo de streaming ou sem streaming?
Utilize o modo sem streaming se precisar apenas do arquivo de áudio final, pois a chamada de API é mais simples. Opte pelo modo de streaming caso necessite receber os dados de áudio progressivamente durante a geração, como para reprodução em tempo real.
Quais são os limites de parâmetros para os modos de streaming e sem streaming?
Os limites de caracteres para lyrics e prompt diferem entre os dois modos. No modo sem streaming, lyrics aceita de 5 a 350 caracteres chineses ou de 5 a 2.000 caracteres em inglês, e prompt aceita de 1 a 2.000 caracteres. No modo de streaming, lyrics aceita de 300 a 350 caracteres chineses ou de 200 a 250 palavras em inglês, e prompt aceita de 5 a 1.000 caracteres (chinês ou inglês).