Skip to main content
Geração de texto

Overview

Um modelo de geração de texto produz conteúdo a partir de prompts em linguagem natural para aplicações como chatbots, criação de conteúdo, resumo de documentos e geração de código.

A entrada pode variar de uma única palavra-chave a prompts complexos e com múltiplas etapas que incluem contexto. Os casos de uso mais comuns incluem:
  • Criação de conteúdo: Geração de artigos de notícias, descrições de produtos e roteiros para vídeos curtos.
  • Atendimento ao cliente: Implementação de chatbots automatizados 24/7 para responder perguntas frequentes.
  • Tradução de texto: Tradução de conteúdo entre vários idiomas.
  • Resumo: Condensação de artigos longos, relatórios e e-mails.
  • Redação de documentos jurídicos: Elaboração de modelos de contratos e pareceres legais.

Conceitos principais

A entrada de um modelo de geração de texto é um prompt, composto por um ou mais objetos de mensagem, cada um contendo uma função e um conteúdo:
  • Mensagem do sistema: Define a persona do modelo, diretrizes de comportamento ou instruções específicas da tarefa. O padrão é "You are a helpful assistant."
  • Mensagem do usuário: A pergunta, instrução ou entrada fornecida pelo usuário ao modelo.
  • Mensagem do assistente: A resposta do modelo. Em conversas de múltiplas rodadas, transmita as mensagens anteriores do assistente para manter o contexto.
Para chamar o modelo, construa um array desses objetos de mensagem chamado messages. Uma solicitação típica consiste em uma mensagem system que define as diretrizes de comportamento e uma mensagem user com a entrada do usuário.
A mensagem system é opcional, mas recomendada. Definir a função e as restrições comportamentais do modelo gera resultados mais consistentes e previsíveis.
[
    {"role": "system", "content": "You are a helpful assistant who provides precise, efficient, and insightful responses, ready to assist users with various tasks and questions."},
    {"role": "user", "content": "Who are you?"}
]
A resposta contém a réplica do modelo em uma mensagem assistant.
{
    "role": "assistant",
    "content": "Hello! I am Qwen, a large-scale language model developed by Tongyi Lab at Alibaba Group. I can help you with tasks like answering questions, creating text, logical reasoning, and coding. I understand and generate multiple languages, and can handle multi-turn conversations and complex instructions. If there is anything you need help with, just let me know!"
}

Início rápido

Pré-requisitos: {{XREF_0}} e {{XREF_1}}. Se estiver usando um SDK, também {{XREF_2}}. O {WorkspaceId} nas URLs base do exemplo é o ID do seu workspace. Para saber como obtê-lo, consulte {{XREF_3}}.
  • OpenAI-compatible Chat Completions API
  • OpenAI-Compatible Responses API
  • DashScope
  • Python
  • Java
  • Node.js
  • Go
  • C# (HTTP)
  • PHP (HTTP)
  • curl
import os
from openai import OpenAI

try:
    client = OpenAI(
        # API keys vary by region. To obtain an API key, see https://www.alibabacloud.com/help/en/model-studio/get-api-key
        # If you haven't set the environment variable, replace the following line with your Alibaba Cloud Model Studio API key: api_key="sk-xxx",
        api_key=os.getenv("DASHSCOPE_API_KEY"),
        # Endpoint for the Asia Pacific SE 1 (Singapore) region. Replace {WorkspaceId} with your Workspace ID. URLs vary by region.
        base_url="https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/compatible-mode/v1",
    )

    completion = client.chat.completions.create(
        model="qwen3.8-max",
        messages=[
            {"role": "system", "content": "You are a helpful assistant."},
            {"role": "user", "content": "Who are you?"},
        ],
    )
    print(completion.choices[0].message.content)
    # To view the full response, uncomment the following line.
    # print(completion.model_dump_json())
except Exception as e:
    print(f"Error message: {e}")
    print("For more information, see the documentation: https://www.alibabacloud.com/help/en/model-studio/error-code")

Resposta

I am Qwen, a large-scale language model developed by Tongyi Lab at Alibaba Group. I can help you answer questions and create content, such as writing stories, official documents, emails, and scripts. I can also do logical reasoning, program, share opinions, play games, and more. If you have any questions or need help, feel free to ask!

Processamento de dados de imagem e vídeo

Modelos multimodais processam dados não textuais (imagens, vídeos) para tarefas como resposta a perguntas visuais e detecção de eventos. Eles diferem dos modelos apenas de texto em dois aspectos:
  • Construção da mensagem do usuário: Mensagens de usuário multimodais incluem texto e dados não textuais, como imagens e áudio.
  • Interfaces do SDK DashScope: Utilize a interface MultiModalConversation para o SDK Python do DashScope e a classe MultiModalConversation para o SDK Java do DashScope.
Para limitações sobre arquivos de imagem e vídeo, consulte {{XREF_14}} .
  • OpenAI compatible chat completions
  • DashScope
  • Python
  • Node.js
  • curl
from openai import OpenAI
import os

client = OpenAI(
    # API keys vary by region. To get an API key: https://www.alibabacloud.com/help/en/model-studio/get-api-key
    # If the environment variable is not set, provide your Model Studio API key directly, for example: api_key="sk-xxx"
    api_key=os.getenv("DASHSCOPE_API_KEY"),
    # The endpoint URL varies by region. Modify it for your region.
    base_url="https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/compatible-mode/v1"
)
messages = [
    {
        "role": "user",
        "content": [
                {
                    "type": "image_url",
                    "image_url": {
                        "url": "https://help-static-aliyun-doc.aliyuncs.com/file-manage-files/zh-CN/20251031/ownrof/f26d201b1e3f4e62ab4a1fc82dd5c9bb.png"
                    },
                },
            {"type": "text", "text": "What products are shown in the image?"},
        ],
    }
]
completion = client.chat.completions.create(
    model="qwen3.6-plus",
    messages=messages,
)
print(completion.choices[0].message.content)
from openai import OpenAI
import os

client = OpenAI(
    # API keys vary by region. To get an API key: https://www.alibabacloud.com/help/en/model-studio/get-api-key
    # If the environment variable is not set, provide your Model Studio API key directly, for example: api_key="sk-xxx"
    api_key=os.getenv("DASHSCOPE_API_KEY"),
    # This is the endpoint for the Singapore region. Replace {WorkspaceId} with your WorkspaceId. Endpoints vary by region.
    base_url="https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/compatible-mode/v1"
)
messages = [
    {
        "role": "user",
        "content": [
            {
                "type": "image_url",
                "image_url": {
                    "url": "https://help-static-aliyun-doc.aliyuncs.com/file-manage-files/zh-CN/20251031/ownrof/f26d201b1e3f4e62ab4a1fc82dd5c9bb.png"
                },
            },
            {"type": "text", "text": "What products are shown in the image?"},
        ],
    }
]
completion = client.chat.completions.create(
    model="qwen3.6-plus",
    messages=messages,
)
print(completion.choices[0].message.content)

Chamadas assíncronas

Chamadas assíncronas melhoram o throughput para cargas de trabalho de alta concorrência.
  • OpenAI-compatible chat completions API
  • DashScope
Python
import os
import asyncio
from openai import AsyncOpenAI
import platform

# Create an asynchronous client instance.
client = AsyncOpenAI(
    # API keys vary by region. To get an API key, see https://www.alibabacloud.com/help/en/model-studio/get-api-key
    # If you have not set the environment variable, replace the following line with your Model Studio API key: api_key="sk-xxx",
    api_key=os.getenv("DASHSCOPE_API_KEY"),
    # This is the URL for the Singapore region. Replace {WorkspaceId} with your workspace ID.
    base_url="https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/compatible-mode/v1"
)

# Define an asynchronous task.
async def task(question):
    print(f"Sending question: {question}")
    response = await client.chat.completions.create(
        messages=[
            {"role": "user", "content": question}
        ],
        model="qwen-plus",  # For a list of models, see https://www.alibabacloud.com/help/en/model-studio/getting-started/models
    )
    print(f"Model response: {response.choices[0].message.content}")

# Main asynchronous function.
async def main():
    questions = ["Who are you?", "What can you do?", "What's the weather like?"]
    tasks = [task(q) for q in questions]
    await asyncio.gather(*tasks)

if __name__ == '__main__':
    # Set the event loop policy.
    if platform.system() == 'Windows':
        asyncio.set_event_loop_policy(asyncio.WindowsSelectorEventLoopPolicy())
    # Run the main coroutine.
    asyncio.run(main(), debug=False)

Exemplo de resposta
Como as chamadas são assíncronas, a ordem das respostas pode diferir deste exemplo.
Sending question: Who are you?
Sending question: What can you do?
Sending question: What's the weather like?
Model response: Hello! I'm Qwen, a large-scale language model developed by Tongyi Lab at Alibaba Group. I can help you answer questions and create content, such as writing stories, official documents, emails, and scripts. I can also do logical reasoning, programming, share opinions, play games, and more. If you have any questions or need help, feel free to ask!
Model response: Hello! I am currently unable to access real-time weather information. You can tell me your city or region, and I will do my best to provide you with general weather advice or information. Alternatively, you can use a weather app to check the real-time weather conditions.
Model response: I have many skills, for example:

1. Answering questions: Whether it's academic questions, general knowledge, or professional topics, I can try to help you find answers.
2. Creating text: I can write various types of text, such as stories, official documents, emails, and scripts.
3. Logical reasoning: I can help you solve logical reasoning problems, such as math problems and riddles.
4. Programming: I can provide programming assistance, including code writing, debugging, and optimization.
5. Multilingual support: I support multiple languages, including but not limited to Chinese, English, French, and Spanish.
6. Expressing opinions: I can offer you some perspectives and suggestions to help you make decisions.
7. Playing games: We can play text-based games together, such as riddles or idiom solitaire.

If you have any specific needs or questions, feel free to let me know, and I will do my best to help you!

Uso em produção

Construção de contexto de alta qualidade

Fornecer grandes volumes de dados brutos ao modelo aumenta custos e pode degradar o desempenho devido às limitações da janela de contexto. A engenharia de contexto — carregamento dinâmico de conhecimento preciso — melhora a qualidade e a eficiência da geração. As principais técnicas incluem:
  • Engenharia de prompt: Projete e otimize prompts de texto para guiar o modelo em direção à saída desejada. Para mais informações, consulte {{XREF_19}} do Alibaba Cloud Model Studio.
  • {{XREF_20}}: Permite que o modelo responda perguntas a partir de uma base de conhecimento externa, como documentação de produtos ou manuais técnicos.
  • {{XREF_21}}: Recupera informações em tempo real (clima, tráfego) ou executa ações (chamadas de API, envio de e-mails) em nome do modelo.
  • Memória: Fornece memória de longo e curto prazo para que o modelo possa recordar o contexto em conversas de múltiplas rodadas.

Controle da diversidade da resposta

Os parâmetros temperature e top_p controlam a diversidade do texto gerado. Valores mais altos aumentam a diversidade; valores mais baixos aumentam o determinismo. Para isolar o efeito de cada parâmetro, ajuste apenas um por vez.
  • temperature: Intervalo: [0, 2). Ajusta principalmente a aleatoriedade.
  • top_p: Intervalo: [0, 1]. Filtra as respostas com base em um limiar de probabilidade.
Os exemplos a seguir mostram como as configurações de parâmetros afetam a saída. Prompt de entrada: "Escreva uma história curta de três frases onde os personagens principais são um gato e um raio de sol."
  • Alta diversidade (Exemplo: temperature=0.9): Ideal para escrita criativa, brainstorming ou textos de marketing.
Sunlight slanted across the windowsill, and the orange cat crept toward the bright patch as its fur turned the color of melted honey.
It reached out and tapped the light, then sank into it as if stepping into a warm pool, and the sunlight flowed up its back in a quiet tide.
The afternoon grew heavy—curled in drifting gold, the cat heard time melt softly inside its purr.
  • Alto determinismo (Exemplo: temperature=0.1): Mais indicado para respostas a perguntas factuais, geração de código ou textos jurídicos.
In the afternoon, an old cat curled on the windowsill and dozed while counting the spots of light.
Sunlight hopped across its mottled back, like turning the pages of an old photo album.
Dust rose and fell, as if time whispered: you were once young, and I was once fierce.
temperature:
  • Uma temperatura mais alta achata a distribuição de probabilidade dos tokens, tornando os tokens menos prováveis mais frequentes e aumentando a aleatoriedade da saída.
  • Uma temperatura mais baixa aguça a distribuição, tornando os tokens de alta probabilidade ainda mais frequentes e reduzindo a aleatoriedade da saída.
top_p:A amostragem top_p (núcleo) seleciona o menor conjunto de tokens cuja probabilidade cumulativa atinge ou excede o limiar top_p. Os tokens são ordenados por probabilidade e acumulados até que o limiar seja atingido; em seguida, o próximo token é amostrado aleatoriamente desse conjunto reduzido.
  • Um top_p mais alto amplia o pool de seleção de tokens, produzindo texto mais diversificado.
  • Um top_p mais baixo restringe o pool, produzindo texto mais focado e determinístico.
# Recommended parameter settings for common scenarios
SCENARIO_CONFIGS = {
    # Creative writing
    "creative_writing": {
        "temperature": 0.9,
        "top_p": 0.95
    },
    # Code generation
    "code_generation": {
        "temperature": 0.2,
        "top_p": 0.8
    },
    # Factual Q&A
    "factual_qa": {
        "temperature": 0.1,
        "top_p": 0.7
    },
    # Translation
    "translation": {
        "temperature": 0.3,
        "top_p": 0.8
    }
}

# OpenAI example
# completion = client.chat.completions.create(
#     model="qwen-plus",
#     messages=[{"role": "user", "content": "Write a poem about the moon"}],
#     **SCENARIO_CONFIGS["creative_writing"]
# )
# DashScope example
# response = Generation.call(
#     # If you have not set an environment variable, replace the following line with your Alibaba Cloud Model Studio API key: api_key = "sk-xxx",
#     api_key=os.getenv("DASHSCOPE_API_KEY"),
#     model="qwen-plus",
#     messages=[{"role": "user", "content": "Write a Python function that determines whether the input n is a prime number. Output code only."}],
#     result_format="message",
#     **SCENARIO_CONFIGS["code_generation"]
# )

Mais recursos

Para cenários mais complexos, os seguintes recursos estão disponíveis:
  • {{XREF_22}}: Para interação contínua, como perguntas de acompanhamento ou coleta de informações.
  • {{XREF_23}}: Retorna tokens incrementalmente à medida que são gerados, evitando timeouts em chatbots e geração de código em tempo real.
  • {{XREF_24}}: Produz respostas de maior qualidade e mais estruturadas para raciocínio complexo ou análise estratégica.
  • {{XREF_25}}: Restringe as respostas a um formato JSON consistente para uso programático e análise de dados.
  • {{XREF_26}}: Continua a geração a partir de texto existente, útil para conclusão de código ou escrita de textos longos.

Referência da API

Para todos os parâmetros, consulte {{XREF_27}} e {{XREF_28}}.

FAQ

P: Por que a contagem de tokens de entrada é maior que a contagem de tokens do texto que enviei?

R: Ao processar uma conversa, o sistema usa um Chat Template para encapsular o texto bruto de entrada, adicionando marcadores de controle como identificadores de função e limites de mensagem. Esses marcadores gerados pelo sistema também são contabilizados como tokens. Por exemplo, quando você envia a mensagem {"role": "user", "content": "Hi"} para o qwen3.8-max, o texto "Hi" corresponde a apenas 1 token após a tokenização. No entanto, durante o processamento do sistema, o texto completo real da entrada é formatado da seguinte maneira: <|im_start|>user\nHi<|im_end|>\n<|im_start|>assistant\n<think>. Após a tokenização, esse texto completo aumenta a contagem total de tokens de entrada para 11. R: A API Qianwen não pode acessar diretamente o conteúdo de páginas da web. Em vez disso, use {{XREF_29}}, ou uma ferramenta de web scraping como Beautiful Soup do Python para extrair o conteúdo e passá-lo ao modelo.

P: Diferenças de resposta:Qianwen (Web)vs. API Qianwen

R: O Qianwen (Web) adiciona funcionalidades sobre a API Qianwen, incluindo análise de páginas da web, busca na web, criação de imagens e geração de PPT. Estes não estão incluídos na API base, mas você pode criar funcionalidades semelhantes usando , {{XREF_32}}.

P: Geração de arquivos Word, Excel, PDF ou PPT

R: Não. Modelos de geração de texto produzem apenas texto simples. Converta a saída para o formato desejado usando seu próprio código ou bibliotecas de terceiros .
Plano de Tokens
Playground de Modelos
Inferência do Modelo
Avaliação
Compressão de Modelos
Estatísticas e Monitoramento
Suporte