Skip to main content
語音翻譯

音視頻翻譯-通義千問 API 參考

本文介紹通過 OpenAI 相容介面調用 qwen3-livetranslate-flash 模型的輸入與輸出參數。

相關文檔:音視頻檔案翻譯-千問
不支援通過 DashScope 介面調用。

OpenAI 相容

  • 新加坡地區
  • 北京地區
SDK 調用配置的base_url為:https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/compatible-mode/v1HTTP 調用配置的endpointPOST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/compatible-mode/v1/chat/completions
阿里雲百鍊為華北2(北京)、新加坡地區推出了業務空間專屬網域名稱,能夠為推理請求提供卓越的效能和更高的穩定性,建議遷移至新網域名稱:
  • 華北2(北京)地區:從 https://dashscope.aliyuncs.com 遷移至 https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com
  • 新加坡地區:從 https://dashscope-intl.aliyuncs.com 遷移至 https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com
其中 {WorkspaceId} 為您的業務空間 ID,可在阿里雲百鍊控制台的業務空間詳情頁面查看。現有網域名稱仍可正常使用。
您需要已擷取API Key配置API Key到環境變數。若通過OpenAI SDK進行調用,需要安裝SDK

請求體

modelstring(必選)模型名稱。支援的模型:qwen3-livetranslate-flash、qwen3-livetranslate-flash-2025-12-01。messagesarray(必選)訊息數組,用於向大模型傳遞上下文。僅支援傳入一個 User Message。

訊息類型

User Messageobject(必選)使用者訊息。
contentarray(必選)訊息內容。
typestring(必選)可選值:
  • input_audio 輸入音頻時需設為input_audio
  • video_url 輸入視頻檔案時需設為video_url
input_audioobject輸入的音頻資訊。當typeinput_audio時是必選參數。
data string(必選)音訊 URL 或Base64 Data URL。傳入本地檔案請參見:輸入 Base 64 編碼的本地檔案formatstring(必選)輸入音訊格式,如mp3wav等。
video_urlobject輸入的視頻檔案資訊。當typevideo_url時是必選參數。
url string(必選)視頻檔案的公網 URL 或 Base64 Data URL。輸入本地視頻檔案請參見輸入 Base 64 編碼的本地檔案
rolestring(必選)使用者訊息的角色,固定為user
streamboolean(必選) 預設值為 false是否以流式方式輸出回複。模型僅支援流式輸出方式調用,僅可設為truestream_optionsobject(可選)流式輸出的配置項,僅在 streamtrue 時生效。

屬性

include_usageboolean(可選)預設值為 false是否在最後一個資料區塊包含Token消耗資訊。可選值:
  • true:包含;
  • false:不包含。
modalitiesarray(可選)預設值為["text"]輸出資料的模態。可選值:
  • ["text","audio"]:輸出文本與音頻;
  • ["text"]:僅輸出文本。
audioobject(可選)輸出音訊音色與格式。modalities參數需為["text","audio"]
voicestring (必選)輸出音訊音色。請參見支援的音色formatstring (必選)輸出音訊格式,僅支援設定為wav
max_tokensinteger(可選)用於限制模型輸出的最大 Token 數。若產生內容超過此值,響應將被截斷。預設值與最大值均為模型的最大輸出長度,請參見模型選型seedinteger(可選)隨機數種子。用於確保在相同輸入和參數下產生結果可複現。若調用時傳入相同的 seed 且其他參數不變,模型將儘可能返回相同結果。取值範圍:[0,2 31 −1]speech_ratefloat(可選)預設值為1.0控制輸出音訊語速。1.0為正常語速,小於1.0為慢速,大於1.0為快速。取值範圍:[0.5, 2.0]。temperaturefloat(可選)預設值為0.000001採樣溫度,控制模型產生內容的多樣性。temperature越高,產生的內容更多樣,反之更確定。取值範圍: [0, 2)為了翻譯的準確性,不建議修改該值。top_pfloat(可選)預設值為0.8核採樣的機率閾值,控制模型產生內容的多樣性。top_p越高,產生的內容更多樣。反之更確定。取值範圍:(0,1.0]為了翻譯的準確性,不建議修改該值。presence_penalty float(可選)預設值為0控制模型產生文本時的內容重複度。取值範圍:[-2.0, 2.0]。正值降低重複度,負值增加重複度。為了翻譯的準確性,不建議修改該值。top_kinteger(可選)預設值為1產生過程中採樣候選集的大小。例如,取值為50時,僅將單次產生中得分最高的50個Token組成隨機採樣的候選集。取值越大,產生的隨機性越高;取值越小,產生的確定性越高。取值為None或當top_k大於100時,表示不啟用top_k策略,此時僅有top_p策略生效。取值需要大於或等於0。為了翻譯的準確性,不建議修改該值。該參數非OpenAI標準參數。通過 Python SDK調用時,請放入 extra_body 對象中,配置方式為:extra_body={"top_k": xxx};通過 Node.js SDK 或 HTTP 方式調用時,請作為頂層參數傳遞。repetition_penaltyfloat(可選)預設值為1.05模型產生時連續序列中的重複度。提高repetition_penalty時可以降低模型產生的重複度,1.0表示不做懲罰。取值大於0即可。為了翻譯的準確性,不建議修改該值。該參數非OpenAI標準參數。通過 Python SDK調用時,請放入 extra_body 對象中,配置方式為:extra_body={"repetition_penalty": xxx};通過 Node.js SDK 或 HTTP 方式調用時,請作為頂層參數傳遞。translation_optionsobject(必選)需配置的翻譯參數。

屬性

source_lang string (可選)源語言的英文全稱,請參見支援的語種。若不設定,模型會自動識別輸入的語種。target_lang string (必選)目標語言的英文全稱,請參見支援的語種
該參數非OpenAI標準參數。通過 Python SDK調用時,請放入 extra_body 對象中,配置方式為:extra_body={"translation_options": xxx};通過 Node.js SDK 或 HTTP 方式調用時,請作為頂層參數傳遞。
import os
from openai import OpenAI

client = OpenAI(
    # 若沒有配置環境變數,請用阿里雲百鍊API Key將下行替換為:api_key="sk-xxx",
    api_key=os.getenv("DASHSCOPE_API_KEY"),
    # 以下為新加坡地區URL,調用時請將{WorkspaceId}替換為真實的業務空間ID,各地區的URL不同。
    base_url="https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/compatible-mode/v1",
)

# ----------------音頻輸入 ----------------
messages = [
    {
        "role": "user",
        "content": [
            {
                "type": "input_audio",
                "input_audio": {
                    "data": "https://help-static-aliyun-doc.aliyuncs.com/file-manage-files/zh-CN/20250211/tixcef/cherry.wav",
                    "format": "wav",
                },
            }
        ],
    }
]

# ----------------視頻輸入(需取消注釋)----------------
# messages = [
#     {
#         "role": "user",
#         "content": [
#             {
#                 "type": "video_url",
#                 "video_url": {
#                     "url": "https://help-static-aliyun-doc.aliyuncs.com/file-manage-files/zh-CN/20241115/cqqkru/1.mp4"
#                 },
#             }
#         ],
#     },
# ]

completion = client.chat.completions.create(
    model="qwen3-livetranslate-flash",
    messages=messages,
    modalities=["text", "audio"],
    audio={"voice": "Cherry", "format": "wav"},
    stream=True,
    stream_options={"include_usage": True},
    extra_body={"translation_options": {"source_lang": "zh", "target_lang": "en"}},
)

for chunk in completion:
    print(chunk)

chat響應chunk對象(流式輸出)

idstring本次調用的唯一識別碼。每個chunk對象有相同的 id。choicesarray模型產生內容的數組。若設定include_usage參數為true,則choices在最後一個chunk中為空白數組。
delta object請求的增量對象。
content string增量訊息內容。reasoning_content string該值固定為nullfunction_call object該值固定為nullaudioobject輸出的音頻資訊。
data string增量的 Base64 音頻編碼資料。expires_at integer建立請求時的時間戳記。id string輸出音訊唯一識別碼。
refusal object該參數當前固定為nullrole string增量訊息對象的角色,只在第一個chunk中有值。tool_calls array該值固定為null
finish_reason string模型停止產生的原因。有以下情況:
  • 自然停止輸出時為stop
  • 產生未結束時為null
  • 產生長度過長而結束為length
index integer當前響應在choices數組中的索引,固定為0。logprobsobject該值固定為null
createdinteger本次請求被建立時的時間戳記。每個chunk有相同的時間戳記。modelstring本次請求使用的模型。object string始終為chat.completion.chunkservice_tier string該值固定為nullsystem_fingerprintstring該值固定為nullusage object本次請求消耗的Token。只在include_usagetrue時,在最後一個chunk顯示。
completion_tokens integer模型輸出的 Token 數。prompt_tokens integer輸入 Token 數。total_tokens integer總 Token 數,為prompt_tokenscompletion_tokens的總和。completion_tokens_details object輸出 Token 的詳細資料。
audio_tokensinteger輸出的音頻 Token 數。reasoning_tokens integer該值固定為nulltext_tokensinteger輸出文本 Token 數。
prompt_tokens_details object輸入 Token的細粒度分類。
audio_tokens integer輸入音訊 Token 數。
視頻檔案中的音頻 Token 數通過本參數返回。
text_tokens integer輸入文本的 Token 數。該值固定為0。video_tokens integer輸入視頻的 Token 數。
{
  "id": "chatcmpl-c22a54b8-40cc-4a1d-988b-f84cdf86868f",
  "choices": [
    {
      "delta": {
        "content": " of",
        "function_call": null,
        "refusal": null,
        "role": null,
        "tool_calls": null
      },
      "finish_reason": null,
      "index": 0,
      "logprobs": null
    }
  ],
  "created": 1764755440,
  "model": "qwen3-livetranslate-flash",
  "object": "chat.completion.chunk",
  "service_tier": null,
  "system_fingerprint": null,
  "usage": null
}