É possível chamar os modelos Qwen por meio da API DashScope. Este tópico descreve os parâmetros de entrada e saída e fornece exemplos de chamada.
- Singapore
- US (Virginia)
- China (Beijing)
- Hong Kong (China)
- Germany (Frankfurt)
- Japan (Tokyo)
- Modelos de texto simples, como qwen-plus:
POST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/text-generation/generation - Modelos multimodais, como qwen3.7-plus ou qwen3-vl-plus:
POST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generation
base_url para a configuração de chamada do SDK é o seguinte:- Python code
- Java code
{WorkspaceId} pelo seu workspace ID real.
É necessário obtain an API key e configure it as an environment variable. Caso utilize o DashScope SDK para realizar chamadas, também é preciso install the DashScope SDK.
Corpo da requisição |
|
modelstring(Obrigatório)Nome do modelo a ser utilizado.Os modelos suportados incluem os modelos de linguagem grande Qwen (edições comerciais e open source), Qwen-VL, Qwen-Coder, modelos matemáticos, DeepSeek, Kimi, GLM e MiniMax.Para nomes específicos de modelos e detalhes de faturamento, consulteSelect a model. |
messagesarray(Obrigatório)Contexto transmitido ao modelo de linguagem grande (LLM), organizado em ordem conversacional.Em chamadas via HTTP, coloque messages dentro do objeto input.
Tipos de mensagem Mensagem do sistema object (Opcional)Mensagem de sistema usada para definir a função, o tom, os objetivos da tarefa ou as restrições do LLM. Geralmente, ocupa a primeira posição no array messages.Não recomendamos definir uma mensagem de sistema para modelos QwQ. Para modelos QVQ, a mensagem de sistema não tem efeito.
Propriedades content string(Obrigatório)Conteúdo da mensagem.rolestring(Obrigatório)Função da mensagem de sistema. O valor é fixo como system.object(Obrigatório)Mensagem do usuário utilizada para enviar perguntas, instruções ou contexto ao modelo.
Propriedades content string or array(Obrigatório)Conteúdo da mensagem. Se a entrada for apenas texto, este parâmetro será uma string. Caso a entrada inclua dados multimodais, como imagens, ou se o cache explícito estiver ativado, este parâmetro será um array.
Propriedades text string(Obrigatório)Texto de entrada.imagestring (Opcional)Arquivo de imagem para compreensão de imagens. É possível transmitir uma imagem de três formas:
{"image":"https://xxxx.jpeg"}videoarray or string (Opcional)Vídeo a ser transmitido ao utilizar um Qwen-VL model ou um QVQ model.
float(Opcional)Número de quadros a extrair por segundo. O valor deve estar no intervalo de [0,1, 10]. O valor padrão é 2,0.
Descrição O parâmetro fps possui duas funções:
fps é indicado para cenários com movimento rápido, como eventos esportivos e filmes de ação. Já um valor menor de fps é mais adequado para vídeos longos ou cenários com conteúdo relativamente estático.
Exemplos
integer(Opcional)Número máximo de quadros que podem ser extraídos de um vídeo. Se a quantidade de quadros calculada com base em fps exceder max_frames, o sistema ajustará automaticamente a extração para distribuir os quadros uniformemente dentro do limite de max_frames. Isso garante que o total de quadros não ultrapasse o limite definido.
Faixa de valores
Valor de exemplo {"type": "video_url","video_url": {"url":"https://xxxx.mp4"},"max_frame": 2000}
Em chamadas com uma API compatível com OpenAI, não é possível personalizar o parâmetro min_pixelsinteger(Opcional)Define o limiar mínimo de pixels para a imagem de entrada ou quadros de vídeo. Se o total de pixels de uma imagem ou quadro de vídeo for inferior a min_pixels, a imagem ou quadro será ampliado até que seu total de pixels seja superior a min_pixels.
Faixa de valores
Exemplos
integer(Opcional)Define o limiar máximo de pixels para a imagem de entrada ou quadros de vídeo. Se o total de pixels de uma imagem ou vídeo de entrada estiver dentro do intervalo [min_pixels, max_pixels], o modelo reconhece a imagem original. Caso o total de pixels da imagem de entrada seja maior que max_pixels, a imagem será reduzida até que o total de pixels fique abaixo de max_pixels.
Faixa de valores
Exemplos
integer(Opcional)Limita o total de pixels de todos os quadros extraídos de um vídeo (pixels de um único quadro × número total de quadros). Se o total de pixels do vídeo exceder esse limite, o sistema reduzirá os quadros do vídeo, garantindo ainda que o valor de pixels de um único quadro permaneça dentro do intervalo [min_pixels, max_pixels]. Aplica-se aos modelos Qwen-VL e QVQ.Para vídeos longos com muitos quadros extraídos, recomenda-se reduzir adequadamente esse valor para diminuir o consumo de tokens e o tempo de processamento, embora isso possa resultar na perda de detalhes da imagem.
Faixa de valores
Exemplos
object(Opcional)Suportado apenas por modelos que aceitam explicit caching. Utilizado para ativar o cache explícito.
Propriedades type string(Obrigatório)O valor deve ser ephemeral.string(Obrigatório)Função da mensagem do usuário. O valor deve ser user.object(Opcional)Resposta do modelo à mensagem do usuário.
Propriedades content string(Opcional)Conteúdo da mensagem. Este campo é opcional apenas se o parâmetro tool_calls for especificado na mensagem do assistente.rolestring(Obrigatório)O valor deve ser assistant.partialboolean(Opcional)Especifica se o modo parcial deve ser ativado. Para mais informações e uma lista de modelos suportados, consulte Partial mode.tool_calls array(Opcional)Informações da ferramenta e dos parâmetros de entrada retornadas após iniciar uma chamada de função. Contém um ou mais objetos. Obtido a partir do campo tool_calls da resposta anterior do modelo.
Propriedades id stringID da resposta da ferramenta.type stringTipo da ferramenta. Atualmente, apenas function é suportado.function objectInformações da ferramenta e dos parâmetros de entrada.
Propriedades name stringNome da ferramenta.arguments stringInformações dos parâmetros de entrada, no formato de string JSON.integerÍndice das informações da ferramenta atual no array tool_calls.object (Opcional)Informações de saída da ferramenta.
Propriedades content string(Obrigatório)Conteúdo de saída da função da ferramenta. Deve estar no formato de string.rolestring(Obrigatório)O valor deve ser tool.tool_call_idstring(Opcional)ID retornado após iniciar uma chamada de função. Pode ser recuperado usando response.output.choices[0].message.tool_calls[$index]["id"]. Serve para marcar a ferramenta correspondente à mensagem da ferramenta. |
temperaturefloat(Opcional)Temperatura de amostragem que controla a diversidade do texto gerado pelo modelo.Valores mais altos resultam em textos mais diversos, enquanto valores mais baixos produzem textos mais determinísticos.Intervalo de valores: [0, 2)Ao chamar via HTTP, coloque temperature no objeto parameters. Não recomendamos modificar o valor padrão de temperature para modelos QVQ. |
top_pfloat(Opcional)Limiar de probabilidade para amostragem de núcleo, que controla a diversidade do texto gerado pelo modelo.Um valor top_p mais alto resulta em texto mais diverso, enquanto um valor mais baixo gera texto mais determinístico.Intervalo de valores: (0, 1.0].No SDK Java, este parâmetro é topP. Ao chamar via HTTP, coloque top_p no objeto parameters.
Não recomendamos modificar o valor padrão de |
top_kinteger(Opcional)Tamanho do conjunto de candidatos para amostragem durante a geração. Por exemplo, se você definir este parâmetro como 50, apenas os 50 tokens com as maiores pontuações em uma única geração formarão o conjunto de candidatos para amostragem aleatória. Um valor maior aumenta a aleatoriedade, enquanto um valor menor aumenta o determinismo. Um valor None ou superior a 100 indica que a estratégia top_k não está ativada e apenas a estratégia top_p terá efeito.O valor deve ser maior ou igual a 0.
Valores padrão de top_k Série QVQ: 10Série QwQ: 40modelos anteriores ao restante da série qwen-vl-plus, : 1Todos os outros modelos: 20Série GLM (fornecida pela Alibaba Cloud): 20As séries DeepSeek, Kimi e MiniMax não suportam o parâmetro top_k.No SDK Java, este parâmetro é topK. Ao chamar via HTTP, coloque top_k no objeto parameters.
Não recomendamos modificar o valor padrão de |
enable_thinking boolean (Opcional)Define se o modo de pensamento deve ser ativado para um modelo de pensamento híbrido. Aplica-se aos modelos Qwen3.7, Qwen3.6, Qwen3.5, Qwen3 e Qwen3-VL, além das séries DeepSeek-V4-Pro/V4-Flash, DeepSeek-V3.2/V3.2-exp/V3.1, Kimi-K2.6/K2.5 e GLM. A série DeepSeek-V4 possui o modo de pensamento ativado por padrão. É possível ajustar o esforço de inferência com o parâmetro reasoning_effort.Valores válidos:
No SDK Java, este parâmetro é |
preserve_thinking boolean (Opcional) O valor padrão é false. (Valor padrão para qwen3.8-max:true)Define se o reasoning_content das mensagens do assistente no histórico da conversa deve ser anexado à entrada do modelo. Indicado para cenários em que o modelo precisa consultar o processo de pensamento histórico.Atualmente suportado por qwen3.7-max, qwen3.7-max-2026-05-20 e snapshots subsequentes, qwen3.6-max-preview, qwen3.7-plus, qwen3.7-plus-2026-05-26, qwen3.6-plus, qwen3.6-plus-2026-04-02, qwen3.8-flash, qwen3.7-flash, qwen3.7-flash-2026-07-15, qwen3.6-flash, qwen3.6-flash-2026-04-16, qwen3.8-max (ativado por padrão), kimi-k2.6 (implantado no Alibaba Cloud Model Studio), kimi-k2.7-code (implantado no Alibaba Cloud Model Studio, ativado por padrão), kimi/kimi-k2.7-code-highspeed (fornecido pela Moonshot AI, ativado por padrão) e kimi/kimi-k2.7-code (fornecido pela Moonshot AI, ativado por padrão).Importante (qwen3.8-max): Ao usar qwen3.8-max, preserve_thinking tem como padrão true. Você deve enviar de volta todo o reasoning_content histórico no campo reasoning_content. NÃO concatene reasoning_content no campo content. Isso pode degradar o desempenho do modelo.
Ao chamar via HTTP, coloque preserve_thinking no objeto parameters. O SDK Java não é suportado. |
thinking_budget integer (Opcional)Comprimento máximo do processo de pensamento. Aplica-se aos modelos Qwen3.8, Qwen3.7, Qwen3.6, Qwen3.5, Qwen3-VL, Qwen3, GLM e Kimi. Para mais informações, consulte Limit thinking length.O valor padrão corresponde ao comprimento máximo da cadeia de pensamento do modelo. Para mais informações, consulte Select a model.
No SDK Java, este parâmetro é O valor padrão corresponde ao comprimento máximo da cadeia de pensamento do modelo. |
reasoning_effort string (Opcional)Controla a intensidade de inferência dos modelos. Os valores válidos e padrões variam conforme o modelo.Séries DeepSeek-V4 e GLM (Valor padrão: high)Valores válidos: high (inferência de alta intensidade) e max (inferência de intensidade máxima). low e medium são mapeados para high, e xhigh é mapeado para max.Aplica-se a glm-5.2, glm-5.1, glm-5, deepseek-v4-pro e deepseek-v4-flash.qwen3.8-max: Valor padrão:xhighValores válidos:
max é mapeado para xhigh, high é mapeado para xhigh, minimal é mapeado para low e none é mapeado para enable_thinking=False.Definir valores diferentes dos valores válidos e mapeados acima causará um erro.Para a série qwen3.8, reasoning_effort e thinking_budget não podem ser definidos simultaneamente. Definir ambos causará um erro. No entanto, eles suportam conversão mútua:
Ao chamar via HTTP, coloque reasoning_effort no objeto parameters. |
tool_stream boolean (Opcional) O valor padrão é false.Este parâmetro afeta apenas o comportamento de saída em streaming de parâmetros de ferramentas complexas e é eficaz somente em chamadas com streaming. Parâmetros de ferramentas simples, onde todos os tipos de parâmetros são strings, podem usar streaming desde que as chamadas com streaming estejam ativadas. tool_stream não tem efeito sobre eles. Ferramentas complexas são aquelas em que alguns tipos de parâmetros na definição da ferramenta são arrays ou objetos. Atualmente, apenas as séries Qwen e GLM suportam isso.Lista de suporte da série Qwen:
Ferramentas complexas são aquelas em que alguns tipos de parâmetros na definição da ferramenta são arrays ou objetos.Lista de suporte da série GLM: glm-4.6, glm-4.7, glm-5 e glm-5.1.Referência de uso da série GLM:
Ao chamar via HTTP, coloque tool_stream no objeto parameters. |
enable_code_interpreter boolean (Opcional) O valor padrão é false.Define se o recurso de interpretador de código deve ser ativado. Para mais informações, consulte Code interpreter.Valores válidos:
O SDK Java não é suportado. Ao chamar via HTTP, coloque enable_code_interpreter no objeto parameters. |
clear_thinkingboolean(Opcional) O valor padrão é false.Controla se o reasoning_content (processo de pensamento) de turnos anteriores deve ser usado como entrada de contexto para o modelo em uma conversa de múltiplos turnos. Suportado apenas pelos modelos da série GLM: glm-5.2, glm-5.1, glm-5 e glm-4.7.
|
repetition_penaltyfloat(Opcional)Penalidade para repetição de sequências consecutivas durante a geração do modelo. Um valor repetition_penalty mais alto pode reduzir a repetição na saída do modelo. Um valor de 1.0 indica nenhuma penalidade. O valor deve ser maior que 0.No SDK Java, este parâmetro é repetitionPenalty. Ao chamar via HTTP, coloque repetition_penalty no objeto parameters.
Ao usar o modelo qwen-vl-plus_2025-01-25 para extração de texto, recomendamos definir
Não recomendamos modificar o valor padrão de |
presence_penaltyfloat(Opcional)Controla a repetição de conteúdo quando o modelo gera texto.Intervalo de valores: [-2.0, 2.0]. Valores positivos reduzem a repetição, enquanto valores negativos a aumentam.Em cenários que exigem diversidade, diversão ou criatividade, como escrita criativa ou brainstorming, aumente este valor. Em cenários que enfatizam consistência e precisão terminológica, como documentos técnicos ou textos formais, diminua este valor.
Valores padrão de presence_penalty Qwen3.8 (modo sem pensamento), Qwen3.7 (modo sem pensamento), Qwen3.6 (modo sem pensamento), Qwen3.5-Omni, Qwen3.5 (modo sem pensamento), qwen3-max-preview (modo de pensamento), Qwen3 (modo sem pensamento), Série Qwen3-Instruct/1.7b/4b (modo de pensamento), série QVQ, qwen-max, série qwen2.5-vl, série qwen-vl-max, qwen-vl-plus, Qwen3-VL (sem pensamento): 1.5;qwen3-8b/14b/32b/30b-a3b/235b-a22b (modo de pensamento), qwen-plus/qwen-plus-latest/2025-04-28 (modo de pensamento), qwen-turbo/qwen-turbo/2025-04-28 (modo de pensamento): 0.5;Todos os outros são 0.0.Série DeepSeek (fornecida pela Alibaba Cloud): deepseek-r1, deepseek-r1-0528, versão destilada deepseek-r1-distill-qwen: 1;Série Kimi (fornecida pela Alibaba Cloud): kimi-k2.7-code, kimi-k2.6, kimi-k2.5: 0.0;Série Kimi (fornecida pela Moonshot AI): 0.0;Série MiniMax (fornecida pela Alibaba Cloud): MiniMax-M2.5, MiniMax-M2.1: 0.0;Outros modelos DeepSeek, Kimi, GLM e MiniMax não possuem valor padrão.
Como funciona Se o valor do parâmetro for positivo, o modelo aplica uma penalidade aos tokens que já existem no texto. A penalidade não está relacionada ao número de vezes que o token aparece. Isso reduz a probabilidade de esses tokens reaparecerem, diminuindo a repetição de conteúdo e aumentando a diversidade vocabular.
Exemplo Prompt: Traduza esta frase para chinês: "This movie is good. The plot is good, the acting is good, the music is good, and overall, the whole movie is just good. It is really good, in fact. The plot is so good, and the acting is so good, and the music is so good."Valor do parâmetro 2.0: This movie is great. The plot is fantastic, the acting is superb, and the music is also very beautiful. Overall, the entire film is just incredible. It is actually truly outstanding. The storyline is very exciting, the performances are excellent, and the soundtrack is so moving.Valor do parâmetro 0.0: This movie is good. The plot is good, the acting is good, and the music is good. Overall, the whole movie is very good. In fact, it is really great. The plot is very good, the acting is also very excellent, and the music is equally outstanding.Valor do parâmetro -2.0: This movie is good. The plot is good, the acting is good, and the music is good. Overall, the whole movie is good. In fact, it is really good. The plot is very good, the acting is very good, and the music is very good. Ao usar o modelo qwen-vl-plus para extração de texto, defina presence_penalty como 1.5. Não modifique o valor padrão de presence_penalty para modelos QVQ. O SDK Java não suporta a definição deste parâmetro*.* Ao chamar via HTTP, coloque presence_penalty no objeto parameters. |
vl_high_resolution_imagesboolean(Opcional) Valor padrão: falseDefine se o limite de pixels para imagens de entrada deve ser aumentado para a contagem de pixels correspondente a 16384 tokens. Para mais informações, consulte Processing high-resolution images.
No SDK Java, este parâmetro é vlHighResolutionImages (requer V2.20.8 ou posterior). Ao chamar via HTTP, coloque vl_high_resolution_images no objeto parameters. |
vl_enable_image_hw_outputboolean(Opcional) O valor padrão é false.Define se as dimensões da imagem redimensionada devem ser retornadas. O modelo redimensiona a imagem de entrada. Se você definir este parâmetro como True, ele retornará a altura e a largura da imagem redimensionada. Se a saída em streaming estiver ativada, essa informação será retornada no último chunk. Isso é suportado por Qwen-VL models.No SDK Java, este parâmetro é vlEnableImageHwOutput. A versão mínima necessária do SDK Java é 2.20.8*.* Ao chamar via HTTP, coloque vl_enable_image_hw_output no objeto parameters. |
max_tokensinteger(Opcional, será descontinuado)
Este parâmetro será descontinuado. Para novas integrações, use O significado deste parâmetro varia conforme o modelo:
No SDK Java, este parâmetro é maxTokens. Para modelos Qwen-VL, ele é maxLength no SDK Java, mas versões posteriores à 2.18.4 também suportam a definição como |
max_completion_tokensinteger(Opcional)Comprimento máximo da saída do modelo, incluindo a cadeia de pensamento e a resposta do modelo. Se a saída do modelo exceder esse valor, a geração para antecipadamente e o finish_reason retornado é length.Os valores padrão e máximo correspondem ao comprimento máximo de saída do modelo.Diferença em relação a max_tokens: max_completion_tokens limita a saída completa do modelo (cadeia de pensamento + resposta), enquanto max_tokens limita apenas a parte da resposta. Para modelos de pensamento, recomendamos o uso de max_completion_tokens.Os seguintes modelos são suportados:
Os modelos listados acima não incluem modelos fornecidos diretamente por terceiros.
Pode haver uma diferença de até 10 tokens entre a contagem real de tokens de saída e o valor especificado em O SDK Java atualmente não suporta este parâmetro. Ao chamar via HTTP, coloque max_completion_tokens no objeto parameters. |
seedinteger(Opcional)Semente de número aleatório. Este parâmetro garante resultados reproduzíveis com a mesma entrada e parâmetros. Se você passar o mesmo valor de seed em uma chamada e os outros parâmetros permanecerem inalterados, o modelo retornará o mesmo resultado sempre que possível.Intervalo de valores: [0,2<sup>31</sup>−1].Ao chamar via HTTP, coloque seed no objeto parameters. |
streamboolean(Opcional)O valor padrão é false.Define se a resposta deve ser transmitida em streaming. Os valores válidos são:
Este parâmetro é suportado apenas pelo SDK Python. Para implementar saída em streaming com o SDK Java, chame a interface Qwen3 edição comercial (modo de pensamento), Qwen3 edição open source, QwQ e QVQ suportam apenas saída em streaming. |
incremental_outputboolean(Opcional) O valor padrão é false. Para os modelos Qwen3-Max, Qwen3-VL, Qwen3 open source edition, QwQ e QVQ, o padrão é true.Define se a saída incremental deve ser ativada no modo de streaming. Recomendamos definir este parâmetro como true.Valores:
No SDK Java, este parâmetro é incrementalOutput. Em chamadas via HTTP, inclua incremental_output no objeto parameters. Os modelos QwQ e os modelos Qwen3 no modo de raciocínio aceitam apenas o valor
Os modelos da edição open source do Qwen3 não permitem definir este parâmetro como |
response_formatobject (Opcional) O valor padrão é {"type": "text"}.Formato do conteúdo retornado. Os valores válidos são:
Para mais informações, consulte Structured output. Os modos Ao especificar
No SDK Java, este parâmetro é
Propriedades type string(Obrigatório)Formato do conteúdo retornado. Os valores válidos são:
object(Opcional)Obrigatório quando type é json_schema. Define a estrutura JSON que a saída do modelo deve seguir. Para mais informações, consulte Obtendo saída estruturada.Em chamadas via DashScope, é necessário construir o JSON Schema manualmente. Para o formato e exemplos, consulte Obtendo saída estruturada. O Java SDK ainda não é suportado.
Propriedades name string(Obrigatório)O nome do schema.schemaobject(Obrigatório)O objeto JSON Schema que descreve a estrutura da saída. Use properties para definir a estrutura dos campos, required para listar os campos obrigatórios e additionalProperties para controlar se campos não definidos no schema podem ser retornados. Recomendamos definir additionalProperties como false, para que apenas os campos definidos sejam retornados. Tipos de dados compatíveis: string, number, integer, boolean, object, array e enum. Para mais informações, consulte Guia de configuração.strictboolean(Opcional)Indica se a estrutura definida por schema deve ser seguida estritamente. Recomendamos definir este parâmetro como true. |
result_formatstring(Opcional)O valor padrão é text. Para os modelos Qwen3-Max, Qwen3-VL, QwQ e modelos open source do Qwen3 (exceto qwen3-next-80b-a3b-instruct), o padrão é message.Formato dos dados retornados. Recomendamos definir este parâmetro como message para facilitar multi-turn conversations.
A plataforma unificará futuramente o valor padrão para No SDK Java, este parâmetro é resultFormat. Em chamadas via HTTP, inclua result_format no objeto parameters.
Para os modelos Qwen-VL, QVQ, definir o valor como Os modelos Qwen3-Max, Qwen3-VL e Qwen3 no modo de raciocínio aceitam apenas Ao usar o SDK Java para chamar um modelo open source do Qwen3 e passar |
logprobs boolean (Opcional) O valor padrão é false.Define se as probabilidades logarítmicas dos tokens de saída devem ser retornadas. Os valores válidos são:
Em chamadas via HTTP, inclua logprobs no objeto parameters. |
top_logprobs integer (Opcional) O valor padrão é 0.Especifica a quantidade de tokens candidatos mais prováveis a serem retornados em cada etapa de geração.Intervalo de valores: [0, 5]Este parâmetro só tem efeito se logprobs for true.No SDK Java, este parâmetro é topLogprobs. Em chamadas via HTTP, inclua top_logprobs no objeto parameters. |
ninteger(Opcional) O valor padrão é 1.Número de respostas a serem geradas. O intervalo de valores é 1-4. Para cenários que exigem múltiplas respostas, como escrita criativa ou textos publicitários, defina um valor maior para n.
Atualmente, apenas os modelos Qwen3 (non-thinking mode) são compatíveis. O valor é fixado em 1 se o parâmetro
Definir um valor maior para Em chamadas via HTTP, inclua n no objeto parameters. |
stopstring ou array(Opcional)Usado para especificar palavras de parada. Quando uma string ou token_id definido em stop aparece no texto gerado, a geração é interrompida imediatamente.É possível enviar palavras sensíveis para controlar a saída do modelo.Quando stop é um array, não é permitido combinar Em chamadas via HTTP, inclua stop no objeto parameters. |
toolsarray(Opcional)Array contendo um ou mais objetos de ferramenta que o modelo pode chamar durante a invocação de funções. Para mais informações, consulte Function calling.Ao usar tools, defina result_format como message.O parâmetro tools é obrigatório ao iniciar a invocação de funções ou ao enviar resultados da execução de ferramentas.
Propriedades type string(Obrigatório)Tipo da ferramenta. Atualmente, apenas function é suportado.functionobject(Obrigatório)
Propriedades name string(Obrigatório)Nome da função da ferramenta. Deve conter apenas letras e números, podendo incluir sublinhados e hifens. O comprimento máximo é de 64 caracteres.descriptionstring(Obrigatório)Descrição da função da ferramenta, que auxilia o modelo a decidir quando e como invocá-la.parametersobject(Opcional) O valor padrão é {}.Descrição dos parâmetros da ferramenta, que deve ser um JSON Schema válido. Para detalhes sobre JSON Schema, consulte este link. Se o parâmetro parameters estiver vazio, significa que a ferramenta não possui parâmetros de entrada, como uma ferramenta de consulta de hora.
Para melhorar a precisão das chamadas de ferramentas, recomendamos enviar Em chamadas via HTTP, inclua tools no objeto parameters. Este recurso não é suportado temporariamente para as séries de modelos qwen-vl. |
tool_choicestring ou object(Opcional) O valor padrão é auto.Estratégia de seleção de ferramentas. Configure este parâmetro para forçar um método de chamada de ferramenta para um tipo específico de problema, como sempre usar uma determinada ferramenta ou desativar todas as ferramentas.
No SDK Java, este parâmetro é toolChoice. Em chamadas via HTTP, inclua tool_choice no objeto parameters. |
parallel_tool_calls boolean (Opcional) O valor padrão é false.Define se as chamadas paralelas de ferramentas devem ser ativadas.Valores válidos:
No SDK Java, este parâmetro é parallelToolCalls. Em chamadas via HTTP, inclua parallel_tool_calls no objeto parameters. |
Objeto de resposta de chat (formatos de saída streaming e não-streaming são consistentes) | |
status_codestringCódigo de status da requisição. O valor 200 indica sucesso; qualquer outro valor significa falha.O SDK Java não retorna este parâmetro. Em caso de falha na chamada, uma exceção é lançada contendo o conteúdo de status_code e message. | |
request_idstringID exclusivo desta chamada.O SDK Java retorna este parâmetro como requestId. | |
codestringCódigo de erro. Este campo permanece vazio quando a chamada é bem-sucedida.Apenas o SDK Python retorna este parâmetro. | |
outputobjectInformações sobre o resultado da chamada.
Properties text stringResposta gerada pelo modelo. Se o parâmetro de entrada result_format estiver definido como text, o conteúdo da resposta será retornado neste campo.finish_reasonstringEste parâmetro não estará vazio se o parâmetro de entrada result_format for definido como text.Quatro situações possíveis podem ocorrer:
arrayInformações de saída do modelo. O parâmetro choices é retornado quando result_format é message.
Properties finish_reason stringO valor pode ser um dos seguintes:
objectObjeto de mensagem produzido pelo modelo.
Properties role stringFunção da mensagem de saída, que deve ser assistant.contentstring or arrayConteúdo da mensagem de saída. Será um array ao utilizar modelos das séries qwen-vl ou qwen-audio, e uma string nos demais casos.Este valor fica vazio se houver iniciação de function calling.
Properties text stringConteúdo da mensagem de saída para modelos das séries qwen-vl ou qwen-audio.image_hwarrayAo ativar o parâmetro vl_enable_image_hw_output em um modelo da série Qwen-VL, dois cenários são possíveis:
stringConteúdo do raciocínio profundo do modelo.tool_callsarrayO parâmetro tool_calls é gerado quando o modelo precisa invocar uma ferramenta.
Properties function objectNome da ferramenta invocada e seus parâmetros de entrada.
Properties name stringNome da ferramenta que está sendo chamada.argumentsstringParâmetros de entrada da ferramenta, formatados como uma string JSON.Devido à aleatoriedade nas respostas do LLM, a string JSON de saída pode nem sempre atender aos requisitos da sua função. Recomendamos validar os parâmetros antes de passá-los para a função. integerÍndice do objeto tool_calls atual dentro do array tool_calls.id stringID desta resposta de ferramenta.type stringTipo da ferramenta, que deve ser function.objectInformações de probabilidade para o objeto choices atual.
Properties content arrayArray de tokens com informações de log de probabilidade.
Properties token stringToken atual.bytes arrayLista de bytes UTF-8 brutos do token atual. Útil para reconstruir com precisão o conteúdo de saída, especialmente ao lidar com emojis e caracteres chineses.logprob floatLog de probabilidade do token atual. Um valor nulo indica probabilidade extremamente baixa.top_logprobs arrayTokens mais prováveis na posição atual e seus respectivos logs de probabilidade. A quantidade de elementos corresponde ao parâmetro de entrada top_logprobs.
Properties token stringToken atual.bytes arrayLista de bytes UTF-8 brutos do token atual. Essencial para reconstruir fielmente o conteúdo de saída, principalmente no tratamento de emojis e caracteres chineses.logprob floatLog de probabilidade do token atual. Valor nulo representa probabilidade extremamente baixa. | |
usagemapInformações de tokens desta requisição de chat.
Properties input_tokens integerComprimento do conteúdo de entrada do usuário após conversão para tokens. Para mais detalhes, consulte Additional information.output_tokens integerComprimento do conteúdo de saída do modelo após conversão para tokens.input_tokens_details object (Optional)Detalhes sobre o comprimento do conteúdo de entrada convertido em tokens.
Properties text_tokens integer (Optional)Comprimento do texto de entrada após conversão para tokens.image_tokens integer (Optional)Comprimento da imagem de entrada após conversão para tokens.video_tokens integer (Optional)Comprimento do arquivo de vídeo ou lista de imagens de entrada após conversão para tokens.integerCampo retornado para entradas de texto simples. Representa a soma de input_tokens e output_tokens.image_tokens integerRetornado quando o conteúdo de entrada inclui uma image. Indica o comprimento do conteúdo de imagem do usuário após conversão para tokens.video_tokens integerPresente quando o conteúdo de entrada contém um video. Corresponde ao comprimento do conteúdo de vídeo do usuário convertido em tokens.audio_tokens integerDisponível se o conteúdo de entrada incluir audio. Reflete o comprimento do conteúdo de áudio do usuário após conversão para tokens.output_tokens_details object (Optional)Detalhamento do comprimento da saída convertida em tokens. Apenas alguns modelos retornam este campo.
Properties text_tokens integer (Optional)Comprimento do texto de saída após conversão para tokens.reasoning_tokens integer (Optional)Extensão do processo de raciocínio convertida em tokens. Retornado exclusivamente por modelos de raciocínio.audio_tokens integer (Optional)Duração do áudio de saída em tokens. Campo específico para modelos com saída de áudio.objectClassificação detalhada dos tokens de entrada.
Properties cached_tokens integerQuantidade de tokens que atingiram o cache. Para saber mais sobre cache de contexto, veja Context cache.cache_creation objectDados sobre a criação de explicit cache.
Properties ephemeral_5m_input_tokens integerQuantidade de tokens usados para criar um cache explícito com validade de 5 minutos.integerVolume de tokens consumidos na criação de um cache explícito.cache_type stringAo utilizar explicit caching, o valor será ephemeral. Caso contrário, este parâmetro não existirá. |