通过文本描述和参考音频,一次生成语音、音效与环境音,构建多人对话、播客等完整声音场景。本文介绍效果示例及提示词写法。
适用场景
音频生成不仅将文字转换为语音,还可以一次生成语音、音效和环境音,构建完整的声音场景:
- 语音与对话:单人旁白、多人对话、播客、有声书和广播剧。
- 综合声音场景:为台词搭配雨声、海浪声或游戏场景音效。
效果示例
以下示例展示不同场景的提示词和生成效果。同一提示词多次生成的结果可能不同。
| 场景 | 提示词 | 效果 |
|---|---|---|
| 播客 | ||
| 有声书 | ||
| 广播剧 | ||
| 游戏配音 | ||
编写提示词
将需要的声音写入一段文本描述,区分台词和场景指令。
| 描述要素 | 写法示例 |
|---|---|
| 创作任务 | “两位主播的播客开场”“雨中对话的广播剧片段” |
| 人物及音色 | “角色A为低沉男声,角色B为明亮女声” |
| 台词 | 使用引号标记台词,并注明说话人 |
| 表达方式 | “轻声说”“语气惊讶”“略作停顿后继续” |
| 背景与音效 | “窗外有雨声,室内传来轻微的翻书声” |
| 声音变化 | “脚步声渐近后,角色开始说话” |
使用参考音频
需要提供声音参考时,上传可公开访问的音频 URL,或使用音频的 Base64 数据。在提示词中通过 @voice1、@voice2、@voice3 引用按顺序提供的音频。
例如,提供两条参考音频后,可以使用:
qwen-audio-3.1-tts-next 最多接收 3 条参考音频,每条不超过 30 秒和 10 MB,支持 WAV、MP3、OGG Opus,不支持裸 PCM。参考音频 URL 与 Base64 二选一;使用 URL 时,服务端必须能访问该地址。
支持的模型
| 模型 | 语种 | 输入长度上限 | 单次输出时长上限 |
|---|---|---|---|
| qwen-audio-3.1-tts-next | 中文、英文 | 3000 字符 | 播客:240 秒(4 分钟);其他场景:120 秒 |
接入与费用
- 接口参数、鉴权、参考音频提交方式,请参见音频生成 API参考。
- 按生成音频原始时长计费,调整语速不改变计费时长。价格请参见模型调用计费。