Skip to main content
Geração de texto

Deep thinking

Os modelos de deep thinking realizam raciocínio antes de responder, o que aumenta a precisão em tarefas complexas, como raciocínio lógico e matemática.

Estes exemplos utilizam a Chat Completion API compatível com OpenAI e a DashScope API. Para a Responses API, consulte Deep thinking .

Uso

O Model Studio oferece suporte ao deep thinking em dois modos:
  • Modo de pensamento híbrido: Utilize o parâmetro enable_thinking para alternar entre pensamento ativo e inativo por requisição:
    • Defina como true — o modelo raciocina antes de responder.
    • Defina como false — o modelo responde diretamente, ignorando a etapa de raciocínio.
    • OpenAI compatible
    • DashScope
    # Import dependencies and create a client...
    completion = client.chat.completions.create(
        model="qwen3.8-max", # Select a model
        messages=[{"role": "user", "content": "Who are you"}],
        # Since enable_thinking is not a standard OpenAI parameter, pass it in extra_body.
        extra_body={"enable_thinking":True},
        # Enable streaming output.
        stream=True,
        # Configure the stream to include token consumption information in the last data packet.
        stream_options={
            "include_usage": True
        }
    )
    
  • Modo apenas de pensamento: O modelo sempre raciocina antes de responder — não é possível desativar esse comportamento. O formato da requisição é idêntico ao do modo de pensamento híbrido; o parâmetro enable_thinking não é necessário.
A API retorna o raciocínio no campo reasoning_content e a resposta no campo content. Como o raciocínio adiciona latência, todos os exemplos usam streaming por padrão (recomendado para acompanhar o raciocínio em tempo real). Os modelos comerciais de pensamento também suportam saída sem streaming (síncrona); consulte o FAQ abaixo para detalhes de uso e ressalvas. Alguns modelos (como os open source qwen3-235b-a22b e qwen3-32b) aceitam apenas streaming, e uma chamada síncrona resultará em erro.

Modelos suportados

  • Qwen3.8
  • Qwen3.7
  • Qwen3.6
  • Qwen3.5
Qwen3.8 Max series (modo de pensamento hibrido, pensamento ativado por padrao): qwen3.8-maxQwen3.8 Flash series (modo de pensamento hibrido, pensamento ativado por padrao): qwen3.8-flashQwen3.8 Open-source series (modo de pensamento hibrido, pensamento ativado por padrao): qwen3.8-2.4t-a95b
Plano de Tokens
Playground de Modelos
Inferência do Modelo
Avaliação
Compressão de Modelos
Estatísticas e Monitoramento
Suporte