Skip to main content
Playground de Modelos

Music generation

O Fun-Music gera músicas completas com vocais masculinos ou femininos em chinês ou inglês a partir de um prompt de texto que descreve o estilo musical e a cena, ou a partir de letras personalizadas. O modelo também suporta geração de música instrumental.

O modelo também suporta geração de música instrumental.
Este modelo está atualmente em visualização limitada. Solicite acesso na Model Gallery antes de usá-lo. Este modelo está disponível apenas na região China (Pequim).

Visão geral

O Fun-Music é um modelo de geração de música ponta a ponta. Forneça uma descrição em linguagem natural ou letras personalizadas para receber uma música completa :
  • prompt: Descreva o estilo musical, a cena, o clima e as preferências de instrumentos. O modelo escreve a letra e gera a música automaticamente.
  • lyrics: Forneça letras personalizadas. O modelo compõe e executa uma música com base no seu texto.
  • gender: Selecione vocais masculinos ou femininos (apenas fun-music-v1).
  • Saída em streaming e sem streaming
  • Saída de áudio nos formatos MP3 e WAV

Diferenças entre os dois modelos

O Fun-Music oferece dois modelos com as seguintes diferenças:

Recurso

fun-music-v1

fun-music-preview

prompt

Obrigatório (pelo menos um entre prompt ou lyrics)

Obrigatório

lyrics

Opcional se prompt for fornecido; se ambos forem enviados, lyrics prevalece

Opcional; se fornecido, lyrics tem prioridade

Gênero vocal (gender)

Compatível

Não compatível

Formatos de saída de áudio

Defina o parâmetro format para especificar o formato de saída:

Formato

Características

Casos de uso

mp3

Compressão com perdas, tamanho de arquivo reduzido

Streaming, reprodução online, armazenamento

wav

Formato sem perdas, tamanho de arquivo maior

Pós-produção, reprodução de alta qualidade

Pré-requisitos

  • Uma chave de API. Para mais informações, consulte Obter uma chave de API.
  • Chave de API configurada como variável de ambiente (recomendado):
export DASHSCOPE_API_KEY="sk-xxx"
Substitua {WorkspaceId} no código de exemplo pelo ID real do seu workspace. Para mais informações, consulte Gerenciamento de workspaces.

Início rápido

Os exemplos a seguir demonstram três casos de uso típicos.
  • Gerar uma música a partir de um prompt
  • Gerar uma música a partir de letras
Passe o parâmetro prompt com uma descrição do estilo musical e da cena. O modelo escreverá a letra e comporá a música.
curl
curl -X POST 'https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/audio/music/generation' \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
    "model": "fun-music-v1",
    "input": {
        "prompt": "Fresh summer folk song, acoustic guitar and harmonica accompaniment, upbeat tempo, suitable as background music for travel vlogs",
        "gender": "female"
    }
}'

Guia de composição

Prompt

O parâmetro prompt é o principal meio para descrever sua intenção de criação musical. O modelo escreve a letra, faz os arranjos e gera a música com base na sua descrição. Dica de escrita: Utilize descrições específicas de clima, cena e preferências de instrumentos para obter melhores resultados.
  • Recomendado: Melancholic piano, rainy night yearning
  • Não recomendado: Melancholic music (muito vago)
No seu prompt, especifique instrumentos (como "piano accompaniment", "saxophone solo" ou "guzheng and bamboo flute"), andamento (como "upbeat", "slow" ou "dense drum beats") e tom emocional (como "warm", "melancholic", "intense" ou "laid-back"). O modelo segue essas descrições da forma mais fiel possível. Prompts mais específicos produzem resultados mais precisos.
Exemplos de prompts por estilo

Estilo

Exemplo de prompt

Folk

Uma música folk acolhedora e curativa com violão acústico, contando a história de uma tarde preguiçosa em um café

Chinês tradicional

Uma canção tradicional chinesa com guzheng e flauta de bambu, evocando paisagens enevoadas e uma despedida entre viajantes

Rock

Rock intenso com guitarra elétrica distorcida e batidas densas de bateria, cantando sobre rebeldia juvenil e liberdade

Balada

Uma balada lenta com acompanhamento de piano, silenciosa e profunda, com um toque de melancolia, expressando saudade e memórias

Rap

Um rap hip-hop com batida marcante e bumbos 808, cheio de energia urbana, contando histórias da vida na cidade

Canção infantil

Uma canção infantil alegre com xilofone e tambores manuais, ritmo simples e cativante, ensinando as crianças sobre a natureza

Letras

O parâmetro lyrics aceita suas letras. O modelo compõe uma música que as segue de perto. Use tags de seção para controlar o arranjo das partes da música. Tags de seção musical

Tag

Descrição

[intro]

Introdução, define o clima

[verse]

Verso, conta a história

[chorus]

Refrão, clímax emocional

[bridge]

Ponte, muda a perspectiva

[outro]

Finalização, desvanecimento gradual

Exemplo de letra
[intro]
Piano keys fall gently, the evening breeze is cool.
That summer, heartbeats quietly grew warm.

[verse]
By the classroom window, sunlight slants across your profile.
Borrowing half an eraser, fingertips spark an electric line.
On the way home from school, bicycle bells chase the clouds.
You said the future is far away, but I wanted to walk to the end.

[chorus]
Youth is an unopened letter, filled with brave promises.
Even if the world flickers bright and dark, with you I see the light.
Love is like the sweet rain of early summer, soaking dreams without fear of distance.
We run toward tomorrow with laughter, hand in hand, never looking back.

[bridge]
Later, wind and rain scattered the paper umbrella, silence replaced the answers.
But the song in my heart is unfinished, still waiting for "don't drift apart."

[chorus]
Youth is an unopened letter, filled with brave promises.
Even if the world flickers bright and dark, with you I see the light.
Love is like the sweet rain of early summer, soaking dreams without fear of distance.
We run toward tomorrow with laughter, hand in hand, never looking back.

[outro]
The piano fades, starlight paves the long street.
The story is unfinished, the next page is still passionate.
Requisitos de escrita
  • Originalidade: Não copie nem imite letras, esquemas de rimas ou frases características de músicas publicadas.
  • Segurança do conteúdo: Não inclua conteúdo relacionado a política, violência, pornografia, vulgaridade, terror ou drogas. Mantenha o conteúdo positivo e emocionalmente genuíno.
  • Idioma: Apenas letras em chinês e inglês são compatíveis. Japonês, coreano e outros idiomas não são aceitos.

Gênero vocal (gender)

O parâmetro gender seleciona o gênero do vocal. Compatível apenas com o modelo fun-music-v1. O padrão é female.
  • female: Vocais femininos (padrão)
  • male: Vocais masculinos

Recursos avançados

Saída em streaming

O modo de streaming retorna dados de áudio progressivamente à medida que são gerados, sendo ideal para reprodução em tempo real. Tanto o fun-music-v1 quanto o fun-music-preview suportam esse modo. Para ativar a saída em streaming, adicione X-DashScope-SSE: enable ao cabeçalho da requisição.
Os modos de streaming e sem streaming possuem limites de caracteres diferentes:
  • Modo sem streaming: lyrics aceita de 5 a 350 caracteres chineses ou de 5 a 2.000 caracteres em inglês; prompt aceita de 1 a 2.000 caracteres.
  • Modo de streaming: lyrics aceita de 300 a 350 caracteres chineses ou de 200 a 250 palavras em inglês; prompt aceita de 5 a 1.000 caracteres (chinês ou inglês).
curl
curl -X POST 'https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/audio/music/generation' \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H "Content-Type: application/json" \
-H "X-DashScope-SSE: enable" \
-d '{
    "model": "fun-music-v1",
    "input": {
        "prompt": "High-energy electronic dance music, synthesizer effects, full of energy, suitable for workout scenes",
        "gender": "male"
    }
}'

Modelos e regiões compatíveis

China (Pequim)

Para chamar os modelos a seguir, utilize uma chave de API da região de Pequim:
  • fun-music-v1
  • fun-music-preview
  • China (Pequim)
Para chamar os modelos a seguir, utilize uma chave de API da região de Pequim:
  • fun-music-v1
  • fun-music-preview

Referência da API

Referência da API de geração de música

Perguntas frequentes

Posso especificar instrumentos, andamento ou clima?

Sim. Descreva-os diretamente no seu prompt, como "piano accompaniment, slow tempo, melancholic". O modelo segue essas descrições da forma mais fiel possível. Prompts mais específicos produzem resultados mais precisos. Para dicas detalhadas de escrita de prompts, consulte Prompt.

Qual modelo devo escolher?

O fun-music-v1 permite seleção de gênero vocal e gera áudio de maior qualidade. Já o fun-music-preview aceita letras personalizadas e geração baseada em prompt. Para uma comparação detalhada, consulte Diferenças entre os dois modelos.

Por quanto tempo as URLs de download de áudio são válidas?

As URLs de download dos arquivos de áudio têm validade de 24 horas. Baixe os arquivos dentro desse período. Após a expiração da URL, chame a API novamente para gerar uma nova.

Qual a diferença entre lyrics e prompt?

O parâmetro lyrics recebe suas letras, e o modelo compõe uma música com base nelas. O parâmetro prompt recebe uma descrição em linguagem natural do estilo musical e da cena, fazendo com que o modelo escreva a letra e gere a música automaticamente. Os requisitos dos parâmetros variam conforme o modelo: para o fun-music-v1, pelo menos um dos dois parâmetros é obrigatório; se ambos forem fornecidos, lyrics prevalece. Para o fun-music-preview, o prompt é obrigatório; o lyrics é opcional e tem prioridade sobre o prompt quando fornecido.

Quando devo usar o modo de streaming ou sem streaming?

Utilize o modo sem streaming se precisar apenas do arquivo de áudio final, pois a chamada de API é mais simples. Opte pelo modo de streaming caso necessite receber os dados de áudio progressivamente durante a geração, como para reprodução em tempo real.

Quais são os limites de parâmetros para os modos de streaming e sem streaming?

Os limites de caracteres para lyrics e prompt diferem entre os dois modos. No modo sem streaming, lyrics aceita de 5 a 350 caracteres chineses ou de 5 a 2.000 caracteres em inglês, e prompt aceita de 1 a 2.000 caracteres. No modo de streaming, lyrics aceita de 300 a 350 caracteres chineses ou de 200 a 250 palavras em inglês, e prompt aceita de 5 a 1.000 caracteres (chinês ou inglês).
Plano de Tokens
Playground de Modelos
  • Music generation
Inferência do Modelo
Avaliação
Compressão de Modelos
Estatísticas e Monitoramento
Suporte