Skip to main content
影像編輯

千問-影像編輯Qwen-Image-Edit

千問-影像編輯模型支援多圖輸入和多圖輸出,可精確修改圖內文字、增刪或移動物體、改變主體動作、遷移圖片風格及增強畫面細節。

快速開始

在調用前,您需要擷取API Key,再配置API Key到環境變數 如需通過SDK進行調用,請安裝DashScope SDK。目前,該SDK已支援Python和Java。
請將範例程式碼中的 DASHSCOPE_API_HOST 替換為擷取的 API Host。
  • Python
  • Java
  • curl
import os
import base64
import mimetypes
import dashscope
from dashscope import MultiModalConversation

dashscope.base_http_api_url = 'https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1'

def encode_file(file_path):
    mime_type, _ = mimetypes.guess_type(file_path)
    if not mime_type or not mime_type.startswith("image/"):
        raise ValueError("Unsupported or unrecognized image format")
    with open(file_path, "rb") as image_file:
        encoded_string = base64.b64encode(image_file.read()).decode('utf-8')
    return f"data:{mime_type};base64,{encoded_string}"

# [方法一] 使用公網映像URL
image_url = "https://alidocs.oss-cn-zhangjiakou.aliyuncs.com/res/yBRq1ZPYEaXdyOdv/img/33a80a19-7ac7-4c64-b0fa-7d685b7046a0.png"

# [方法二] 使用Base64編碼映像
# image_url = encode_file("./your_image.png")

response = MultiModalConversation.call(
    api_key=os.getenv("DASHSCOPE_API_KEY"),
    model="qwen-image-3.0-pro",
    messages=[{
        "role": "user",
        "content": [
            {"image": image_url},
            {"text": "幫我產生一張充滿進階感的都市風格女性寫真,畫面中人物完美保留輸入圖片中這位年輕女性的面部特徵與一頭柔順的黑色長髮。人物換上一套彰顯高雅氣質的都市職場穿搭,情境設定在一家裝修現代簡約的高端咖啡店內。"}
        ]
    }],
    prompt_extend=True
)

print(response)
if response.status_code == 200:
    url = response.output.choices[0].message.content[0]["image"]
    print(f"Generated image URL: {url}")
else:
    print(f"Error: {response.code} - {response.message}")
# 需要安裝requests以下載映像: pip install requests
import requests

def download_image(image_url, save_path='output.png'):
    try:
        response = requests.get(image_url, stream=True, timeout=300)  # 設定逾時
        response.raise_for_status()  # 如果HTTP狀態代碼不是200,則引發異常
        with open(save_path, 'wb') as f:
            for chunk in response.iter_content(chunk_size=8192):
                f.write(chunk)
        print(f"映像已成功下載到: {save_path}")

    except requests.exceptions.RequestException as e:
        print(f"映像下載失敗: {e}")

image_url = "https://dashscope-result-sz.oss-cn-shenzhen.aliyuncs.com/xxx.png?Expires=xxx"
download_image(image_url, save_path='output.png')

模型選型建議

  • qwen-image-3.0-pro系列(推薦):千問映像3.0旗艦版,映像產生與編輯能力全面升級,文字渲染、真實質感、語義遵循能力更強。
  • qwen-image-3.0系列:千問映像3.0標準版,兼顧品質與速度。
各地區支援的模型請參見百鍊控制台模型列表。

輸入說明

輸入映像(messages)

messages 是一個數組,且必須僅包含一個對象。該對象需包含 role 和 content 屬性。其中role必須設定為usercontent需要同時包含image(1-3張映像)和text(一條編輯指令)。 輸入圖片必須滿足以下要求:
  • 圖片格式:JPG、JPEG、PNG、BMP、TIFF、WEBP和GIF。
    輸出映像為PNG格式,對於GIF動圖,僅處理其第一幀。
  • 圖片解析度:為獲得最佳效果,建議映像的寬和高均在384像素至3072像素之間。解析度過低可能導致產生效果模糊,過高則會增加處理時間長度。
  • 檔案大小:單張圖片檔案大小不得超過 10MB。
"messages": [
    {
        "role": "user",
        "content": [
            { "image": "圖1的公網URL或Base64資料" },
            { "image": "圖2的公網URL或Base64資料" },
            { "image": "圖3的公網URL或Base64資料" },
            { "text": "您的編輯指令,例如:'圖1中的女生穿著圖2中的黑色裙子按圖3的姿勢坐下'" }
        ]
    }
]

映像輸入順序

多圖輸入時,按照數組中的順序定義映像順序。因此,提示詞引用的映像編號需要與映像數組中的順序一一對應,例如:數組中的第一張圖片為"圖1",第二張為"圖2",或者使用標記形式如"[圖1]"、"[圖2]"。
{
    "content": [
        {"text": "編輯指令,如:將圖1中的鬧鐘放置到圖2的餐桌的花瓶旁邊位置"},
        {"image": "https://example.com/image1.png"},
        {"image": "https://example.com/image2.png"}
    ]
}

輸入映像

輸出映像

image (19)-轉換自-png

圖1

image (20)-轉換自-png

圖2

04e0fc39-7ad6-41e0-9df9-1f69ac3ce825-轉換自-png

提示詞:把圖1移動到圖2上

36ed450d-bd54-4169-b13f-3d0f26d9d360-轉換自-png

提示詞:把圖2移動到圖1上

映像傳入方式

公網URL
  • 提供一個公網可訪問的映像地址,支援 HTTP 或 HTTPS 協議。
  • 樣本值:https://xxxx/img.png
Base64編碼 將影像檔轉換為 Base 64 編碼字串,並按格式拼接:data:{mime_type};base64,{base64_data}
  • {mime_type}:映像的媒體類型,需與檔案格式對應。
  • {base64_data}:檔案經過 Base 64 編碼後的字串。
  • 樣本值:data:image/jpeg;base64,GDU7MtCZz...(樣本已截斷,僅做示範)
完整範例程式碼請參見Python SDK調用Java SDK調用

更多參數

可以通過以下可選參數調整產生效果:
  • n:指定輸出映像數量,預設值為1。qwen-image-3.0系列、qwen-image-2.0系列、qwen-image-edit-max和qwen-image-edit-plus系列模型支援輸出1-6張圖片,qwen-image-edit模型僅支援輸出1張圖片。
  • negative_prompt(反向提示詞):描述不希望在畫面中出現的內容,如“模糊”、“多餘的手指”等,用於輔助最佳化產生品質。
  • watermark:是否在映像右下角添加 "Qwen-Image" 浮水印。預設值為 false
  • seed:隨機數種子。取值範圍是[0, 2147483647]。如果不提供,則演算法自動產生一個隨機數作為種子。使用相同的 seed 值可協助產生內容保持相對穩定。
以下可選參數僅qwen-image-3.0系列、qwen-image-2.0系列、qwen-image-edit-max、qwen-image-edit-plus系列模型支援:
  • size:設定輸出映像的解析度,格式為寬*高,例如"1024*2048"。對於qwen-image-3.0系列模型,像素麵積範圍為512512至20482048,寬高比限制為1:8至8:1,未指定時由模型根據提示詞自動推薦解析度。對於qwen-image-2.0系列模型,支援自由設定寬高,輸出映像總像素需在512512至20482048之間,預設解析度與輸入圖(多圖輸入時為最後一張圖)一致。對於qwen-image-edit-max、qwen-image-edit-plus系列模型,寬和高的取值範圍均為[512, 2048]像素,預設保持與原圖相似的長寬比,總像素接近1024*1024解析度。
  • prompt_extend:是否開啟prompt智能改寫功能,預設值為 true。開啟後,模型將最佳化提示詞,對描述性不足、較為簡單的prompt提升效果較明顯。
完整參數列表請參考千問-影像編輯API

效果概覽

多圖融合

輸入映像1

輸入映像2

輸入映像3

輸出映像

image83

image103

1

2

圖1中的女生戴著圖2中的項鏈,左肩挎著圖3中的包

主體一致性保持

輸入映像

輸出映像1

輸出映像2

輸出映像3

image5

image4

修改為藍底證件照,人物穿上白色襯衫,黑色西裝,打著條紋領帶

image6

人物穿上白色襯衫,灰色西裝,打著條紋領帶,一隻手摸著領帶,淺色背景

image7

人物穿著粗筆刷字型的“千問映像”的黑色衛衣,依靠在護欄邊,陽光照在髮絲上,身後是大橋和海

image12

image13

把這個空調放在客廳,沙發旁邊

image14

在空調出風口增加霧氣,一直到沙發上,並且增加綠葉。

image15

在上方增加白色的手寫體"自然新風 暢享呼吸"

草圖創作

輸入映像

輸出映像

image42

image43

產生一張映像,符合圖1所勾勒出的精緻形狀,並遵循以下描述:一位年輕的女子在陽光明媚的日子裡微笑著,她戴著一副棕色的圓形太陽鏡,鏡框上有豹紋圖案。她的頭髮被整齊地盤起,耳朵上佩戴著珍珠耳環,脖子上圍著一條帶有紫色星星圖案的深藍色圍巾,穿著一件黑色皮夾克。

image44

產生一張映像,符合圖1所勾勒出的精緻形狀,並遵循以下描述:一位年老的老人朝著鏡頭微笑,他的臉上布滿皺紋,頭髮在風中淩亂,戴著一副圓框的老花鏡。脖子上戴著一條破舊的紅色圍巾,上面有星星圖案。穿著一件棉衣。

文創產生

輸入映像

輸出映像

圖片 1

image23

讓這隻熊坐在月亮下(用白色背景上的淺灰彎月輪廓表示),抱著吉他,周圍漂浮著小星星和詩句氣泡,如“Be Kind”。

image22

將這個圖案印在一件T恤和一個手提紙袋上。一個女模特正在展示這些物品。這個女生還戴著一頂鴨舌帽,帽子上寫著"Be kind”。

image21

一個超逼真的1/7比例角色模型,設計為商業產品成品,放置在一台帶有白色拇指鍵盤的iMac電腦桌上。模型站在一個乾淨、圓形的透明亞克力底座上,沒有標籤或文字。專業的攝影棚燈光凸顯了雕刻細節。在背景的iMac螢幕上,展示同一模型的ZBrush建模過程。在模型旁邊,放置一個封裝盒,前面帶有透明窗戶,僅顯示內部透明塑料殼,其高度略高於模型,尺寸合理以容納模型。

image

這隻熊穿著宇航服,伸出手指向遠方

image

這隻熊穿著華麗的舞裙,雙臂展開,做出優雅的舞蹈動作

image

這隻熊穿著運動服,手裡拿著籃球,單腿彎曲

根據深度圖產生映像

輸入映像

輸出映像

image36

image37

產生一張映像,符合圖1所勾勒出的深度圖,並遵循以下描述:在一條街邊的小巷中停放著一輛藍色的單車,背景中有幾株從石縫中長出來的雜草

image38

產生一張映像,符合圖1所勾勒出的深度圖,並遵循以下描述:一輛紅色的破舊的單車停在一條泥濘的小路上,背景是茂密的原始森林

根據關鍵點產生映像

輸入映像

輸出映像

image40

image41

產生一張映像,符合圖1所勾勒出的人體姿態,並遵循以下描述:一位身穿著漢服的中國美女,在雨中撐著油紙傘,背景是蘇州園林。

image39

產生一張映像,符合圖1所勾勒出的人體姿態,並遵循以下描述:一位男生,站在地鐵月台上,他頭上戴著一頂棒球帽,穿著T恤和牛仔褲。背後是飛馳而過的列車。

文字編輯

輸入映像

輸出映像

輸入映像

輸出映像

image

image

將拼字遊戲方塊上'HEALTH INSURANCE’ 替換為'明天會更好'

image

image

將便條上的短語“Take a Breather”更改為“Relax and Recharge”

輸入映像

輸出映像

image53

image45

將“Qwen-Image”換成黑色的滴墨字型

image46

將“Qwen-Image”換成黑色的手寫字型

image49

將“Qwen-Image”換成黑色的像素字型

image54

將“Qwen-Image”換成紅色

image57

將“Qwen-Image”換成藍紫漸層色

image59

將“Qwen-Image”換成糖果色

image63

將“Qwen-Image”材質換成金屬

image64

將“Qwen-Image”材質換成雲朵

image67

將“Qwen-Image”材質換成玻璃

增刪改

能力

輸入映像

輸出映像

新增元素

image

image

在企鵝前方添加一個小型木製標牌,上面寫著“Welcome to Penguin Beach”。

刪除元素

image

image

刪除餐盤上的頭髮

視角轉換

輸入映像

輸出映像

輸入映像

輸出映像

image

image

獲得正視視角

image

image

朝向左側

image

image

獲得後側視角

image

image

朝向右側

老照片處理

能力

輸入映像

輸出映像

老照片修複及上色

image

image

修複老照片,去除劃痕,降低噪點,增強細節,高解析度,畫面真實,膚色自然,面部特徵清晰,無變形。

image31

image32

根據內容智能上色,使映像更生動

API參考

API的輸入輸出參數,請參見千問-影像編輯

錯誤碼

如果模型調用失敗並返回報錯資訊,請參見錯誤碼進行解決。

常見問題

Q:千問影像編輯模型支援哪些語言?

A:目前正式支援簡體中文和英文;其他語言可自行嘗試,但效果存在不確定性。

Q: 如何查看模型調用量?

A: 模型調用完一小時後,請在 模型监控(新加坡)模型监控(北京)頁面,查看模型的調用次數、成功率等指標。詳情請參見賬單查詢與成本管理

Q:如何擷取映像儲存的訪問網域名稱白名單?

A: 模型產生的映像儲存於阿里雲OSS,API將返回一個臨時的公網URL。若需要對該下載地址進行防火牆白名單配置,請注意:由於底層儲存會根據業務情況進行動態變更,為避免到期資訊影響訪問,文檔不提供固定的OSS網域名稱白名單。如有安全管控需求,請聯絡客戶經理擷取最新OSS網域名稱列表。 更多問題請參見映像產生常見問題
Token Plan
模型體驗
用量統計與效能監控
資產中心
服務支援