É possível chamar modelos usando a API Chat compatível com OpenAI. Este documento descreve os parâmetros de entrada e saída e fornece exemplos de chamada.
Instruções
- Leia o conteúdo em inglês para compreender O QUE precisa ser comunicado
- Escreva o texto em português do Brasil DO ZERO — esqueça a estrutura das frases em inglês
- Preserve toda a formatação markdown, blocos de código, links e imagens exatamente como estão
-
Copie os placeholders de xref (
{XREF_N}) literalmente, sem traduzi-los ou modificá-los - Aplique todas as regras específicas do idioma com rigor
- Siga as regras de stopwords com tolerância zero
- Utilize o modo imperativo em etapas numeradas e listas de procedimentos
- Garanta a consistência terminológica — o mesmo termo deve ter a mesma tradução em todo o documento
- Varie os inícios de frase em listas e tabelas — nenhum início deve se repetir mais de 3 vezes
-
Retorne APENAS o documento markdown em português do Brasil, sem explicações
- Singapore
- US (Virginia)
- China (Beijing)
- Hong Kong (China)
- Germany (Frankfurt)
- Japan (Tokyo)
Configuração de chamada do SDK parabase_url:https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/compatible-mode/v1Requisição HTTP:POST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/compatible-mode/v1/chat/completions
{WorkspaceId} pelo seu workspace ID real.
Obtain an API key e defina-o como uma variável de ambiente. Se você utilizar um SDK da OpenAI, também será necessário install the SDK.
Instruções
- Leia o conteúdo em inglês para compreender O QUE precisa ser comunicado
- Escreva o português brasileiro DO ZERO — esqueça a estrutura das frases em inglês
- Preserve toda a formatação markdown, blocos de código, links e imagens exatamente como estão
-
Copie os placeholders xref (
{XREF_N}) literalmente, sem traduzir ou modificar - Aplique todas as regras específicas de idioma rigorosamente
- Aplique as regras de stopwords com tolerância zero
- Use o modo imperativo em passos numerados e listas de procedimentos
- Garanta a consistência terminológica — o mesmo termo deve ter a mesma tradução em todo o documento
- Varie os inícios de frase em listas e tabelas — nenhum iniciador deve se repetir 3 vezes ou mais
-
Retorne APENAS o documento markdown em português brasileiro, sem explicações
Corpo da requisição
- Entrada de texto
- Saída em streaming
- Entrada de imagem
- Python
- Java
- Node.js
- Go
- C# (HTTP)
- PHP (HTTP)
- curl
messages array(Required)Contexto transmitido ao modelo de linguagem grande, organizado em ordem conversacional.Tipo de mensagem
System Messageobject(Optional)Mensagem de sistema que define a função, o tom, a tarefa ou as restrições para o modelo de linguagem grande. Geralmente é o primeiro elemento no arraymessages.Não defina uma mensagem de sistema para modelos QwQ. Mensagens de sistema não têm efeito em modelos QVQ.
User MessagePropriedades
contentstring(Required)Instrução do sistema. Especifica a função, o comportamento, o estilo de resposta e as restrições de tarefa do modelo.rolestring(Required)Função da mensagem de sistema. O valor é fixo comosystem.object(Required)Mensagem do usuário. Transmite perguntas, instruções ou contexto ao modelo.Assistant MessagePropriedades
contentstring or array(Required)Conteúdo da mensagem. O tipo é string se a entrada for apenas texto. O tipo é array se a entrada contiver dados multimodais, como imagens, ou se o cache explícito estiver ativado.rolePropriedades para modelos multimodais ou quando o cache explícito está ativado
typestring(Required)Valores válidos:-
textDefina comotextpara entrada de texto. -
image_urlDefina comoimage_urlpara entrada de imagem. -
input_audioDefina comoinput_audiopara entrada de áudio. -
videoDefina comovideopara entrada de vídeo como uma lista de imagens. -
video_urlDefina comovideo_urlpara entrada de arquivo de vídeo.Apenas alguns modelos Qwen-VL suportam entrada de arquivo de vídeo. Para mais informações, consulte Video understanding (Qwen-VL). Os modelos QVQ e Qwen-Omni suportam entrada direta de arquivo de vídeo.
stringTexto de entrada. Este parâmetro é obrigatório quandotypeétext.image_urlobjectInformações da imagem de entrada. Este parâmetro é obrigatório quandotypeéimage_url.input_audioPropriedades
urlstring(Required)URL ou Data URL codificada em Base64 da imagem. Para passar um arquivo local, consulte Image and video understanding.objectInformações do áudio de entrada. Este parâmetro é obrigatório quandotypeéinput_audio.videoPropriedades
datastring(Required)URL ou Data URL codificada em Base64 do áudio. Para passar um arquivo local, consulte Input a Base64-encoded local file.formatstring(Required)Formato do áudio de entrada, comomp3ouwav.arrayInformações do vídeo de entrada, fornecidas como uma lista de imagens. Este parâmetro é obrigatório quandotypeévideo. Para mais informações sobre seu uso, consulte Video understanding (Qwen-VL), Video understanding (QVQ) ou Video understanding (Qwen-Omni).Valor de exemplo:video_urlobjectInformações do arquivo de vídeo de entrada. Este parâmetro é obrigatório quandotypeévideo_url.O Qwen-VL consegue compreender apenas as informações visuais dos arquivos de vídeo, enquanto o Qwen-Omni compreende tanto as informações visuais quanto as de áudio.fpsPropriedades
urlstring(Required)URL pública ou Data URL codificada em Base64 do arquivo de vídeo. Para inserir um arquivo de vídeo local, consulte Input a Base64-encoded local file.float(Optional)Número de quadros a serem extraídos por segundo. Valores válidos: [0.1, 10]. Valor padrão: 2.0.O intervalo válido para MiniMax/MiniMax-M3 é [0.2, 5], e o valor padrão é 1.
Descrição do recurso
O parâmetro fps tem duas funções:-
Ao inserir um arquivo de vídeo, ele controla a frequência de extração de quadros. Um quadro é extraído a cada f p s 1 segundos.
Isso se aplica a Qwen-VL, QVQ models.
-
Informa ao modelo o intervalo de tempo entre quadros adjacentes para ajudá-lo a entender melhor a progressão do vídeo ao longo do tempo. Isso se aplica tanto a entradas de arquivo de vídeo quanto a listas de imagens. Este recurso é adequado para cenários como localização temporal de eventos ou resumo de conteúdo segmentado.
Suportado pelos modelos Qwen3.7, Qwen3.6, Qwen3.5,
Qwen3-VL,Qwen2.5-VL, Qwen3.5-Omni e QVQ.
fpsé adequado para cenários de movimento rápido, como eventos esportivos ou filmes de ação. Um valor menor defpsé indicado para vídeos longos ou cenas com conteúdo estático.min_pixelsValores de exemplo
- Entrada para lista de imagens:
{"video":["https://xx1.jpg",...,"https://xxn.jpg"],"fps":2} - Entrada de arquivo de vídeo:
{"video": "https://xx1.mp4", "fps":2}
integer(Optional)Define o limiar mínimo de pixels para imagens ou quadros de vídeo de entrada. Se a contagem de pixels de uma entrada for menor quemin_pixels, ela será ampliada até que sua contagem total de pixels seja maior quemin_pixels. Este parâmetro se aplica aos modelos Qwen-VL e QVQ.Faixa de valores
-
Entrada de imagem:
- Qwen3.8, Qwen3.7, Qwen3.6, Qwen3.5, Qwen3-VL: Valor padrão e mínimo:
65536 - Qwen3.5-Omni: Valor padrão e mínimo:
24576 qwen-vl-max,qwen-vl-max-0813,qwen-vl-plus,qwen-vl-plus-0815: Valor padrão e mínimo:4096- Outros modelos
qwen-vl-plus, outros modelosqwen-vl-max, série open sourceQwen2.5-VLe modelos da sérieQVQ: Valor padrão e mínimo:3136
- Qwen3.8, Qwen3.7, Qwen3.6, Qwen3.5, Qwen3-VL: Valor padrão e mínimo:
-
Entrada de arquivo de vídeo ou lista de imagens:
- Qwen3.8, Qwen3.7, Qwen3.6, Qwen3.5, Qwen3.5-Omni, Qwen3-VL (incluindo versões comerciais e open source),
qwen-vl-max,qwen-vl-max-0813,qwen-vl-plus,qwen-vl-plus-0815: Valor padrão:65536. Valor mínimo:4096 - Outros modelos
qwen-vl-plus, outros modelosqwen-vl-max, série open sourceQwen2.5-VLe modelos da sérieQVQ: Valor padrão:50176. Valor mínimo:3136
- Qwen3.8, Qwen3.7, Qwen3.6, Qwen3.5, Qwen3.5-Omni, Qwen3-VL (incluindo versões comerciais e open source),
max_pixelsValores de exemplo
- Entrada de imagem:
{"type": "image_url","image_url": {"url":"https://xxxx.jpg"},"min_pixels": 65536} - Entrada de arquivo de vídeo:
{"type": "video_url","video_url": {"url":"https://xxxx.mp4"},"min_pixels": 65536} - Entrada de lista de imagens:
{"type": "video","video": ["https://xx1.jpg",...,"https://xxn.jpg"],"min_pixels": 65536}
integer(Optional)Especifica o limiar máximo de pixels para imagens ou quadros de vídeo de entrada. Se a contagem de pixels de uma imagem ou vídeo de entrada estiver dentro do intervalo[min_pixels, max_pixels], o modelo processa a imagem original. Se a contagem de pixels for maior quemax_pixels, a imagem é reduzida até que sua contagem de pixels seja menor ou igual amax_pixels. Este parâmetro se aplica aos modelos Qwen-VL e QVQ.Faixa de valores
-
Entrada de imagem:
O valor de
max_pixelsdepende se o parâmetrovl_high_resolution_imagesestá ativado.-
Quando
vl_high_resolution_imageséFalse:- Qwen3.8, Qwen3.7, Qwen3.6, Qwen3.5, Qwen3-VL: Valor padrão:
2621440. Valor máximo:16777216 Qwen3.5-Omni: Valor padrão:1310720. Valor máximo:16777216qwen-vl-max,qwen-vl-max-0813,qwen-vl-plus,qwen-vl-plus-0815: Valor padrão:1310720. Valor máximo:16777216- Outros modelos
qwen-vl-plus, outros modelosqwen-vl-max, série open sourceQwen2.5-VLe modelos da sérieQVQ: Valor padrão:1003520. Valor máximo:12845056
- Qwen3.8, Qwen3.7, Qwen3.6, Qwen3.5, Qwen3-VL: Valor padrão:
-
Quando
vl_high_resolution_imageséTrue:- Qwen3.8, Qwen3.7, Qwen3.6, Qwen3.5-Omni, Qwen3.5, Qwen3-VL,
qwen-vl-max,qwen-vl-max-0813,qwen-vl-plus,qwen-vl-plus-0815:max_pixelsé inválido. A contagem máxima de pixels para imagens de entrada é fixa em16777216. - Outros modelos
qwen-vl-plus, outros modelosqwen-vl-max, série open sourceQwen2.5-VLe modelos da sérieQVQ:max_pixelsé inválido. A contagem máxima de pixels para imagens de entrada é fixa em12845056.
- Qwen3.8, Qwen3.7, Qwen3.6, Qwen3.5-Omni, Qwen3.5, Qwen3-VL,
-
Quando
-
Entrada de arquivo de vídeo ou lista de imagens:
- Série Qwen3.8, série Qwen3.7, série Qwen3.6, série Qwen3.5, Qwen3.5-Omni, série closed-source Qwen3-VL,
qwen3-vl-235b-a22b-thinking,qwen3-vl-235b-a22b-instruct: Valor padrão:655360. Valor máximo:2048000 - Outros modelos open source
Qwen3-VL,qwen-vl-max,qwen-vl-max-0813,qwen-vl-plus,qwen-vl-plus-0815: Valor padrão:655360. Valor máximo:786432 - Outros modelos
qwen-vl-plus, outros modelosqwen-vl-max, série open sourceQwen2.5-VLe modelos da sérieQVQ: Valor padrão:501760. Valor máximo:602112
- Série Qwen3.8, série Qwen3.7, série Qwen3.6, série Qwen3.5, Qwen3.5-Omni, série closed-source Qwen3-VL,
total_pixelsValores de exemplo
- Entrada de imagem:
{"type": "image_url","image_url": {"url":"https://xxxx.jpg"},"max_pixels": 8388608} - Entrada de arquivo de vídeo:
{"type": "video_url","video_url": {"url":"https://xxxx.mp4"},"max_pixels": 655360} - Entrada de lista de imagens:
{"type": "video","video": ["https://xx1.jpg",...,"https://xxn.jpg"],"max_pixels": 655360}
integer(Optional)Limita a contagem total de pixels de todos os quadros extraídos de um vídeo, calculada como (pixels por quadro × total de quadros). Se a contagem total de pixels do vídeo exceder esse limite, o sistema reduzirá os quadros do vídeo. O sistema garante que a contagem de pixels de um único quadro permaneça dentro do intervalo[min_pixels, max_pixels]. Este parâmetro se aplica aos modelos Qwen-VL e QVQ.Para vídeos longos com muitos quadros extraídos, reduza este valor para diminuir o consumo de tokens e o tempo de processamento, mas isso pode resultar em perda de detalhes da imagem.Faixa de valores
Série Qwen3.8,série Qwen3.7,série Qwen3.6,série Qwen3.5: Valor padrão e máximo:819200000. Isso corresponde a800000tokens de imagem (1 token de imagem por 32×32 pixels).Série closed-source Qwen3-VL,qwen3-vl-235b-a22b-thinking,qwen3-vl-235b-a22b-instruct: Valor padrão e máximo:134217728. Isso corresponde a131072tokens de imagem (1 token de imagem por 32×32 pixels).Qwen3.5-Omni: Valor padrão e mínimo:184549376. Isso corresponde a180224tokens de imagem (1 token de imagem por 32×32 pixels).- Outros modelos open source
Qwen3-VL,qwen-vl-max,qwen-vl-max-0813,qwen-vl-plus,qwen-vl-plus-0815: Valor padrão e mínimo:67108864. Isso corresponde a65536tokens de imagem (1 token de imagem por 32×32 pixels). - Outros modelos
qwen-vl-plus, outros modelosqwen-vl-max, série open sourceQwen2.5-VLe modelos da sérieQVQ: Valor padrão e mínimo:51380224. Isso corresponde a65536tokens de imagem (1 token de imagem por 28×28 pixels).
cache_controlValores de exemplo
- Entrada de arquivo de vídeo:
{"type": "video_url","video_url": {"url":"https://xxxx.mp4"},"total_pixels": 134217728} - Entrada de lista de imagens:
{"type": "video","video": ["https://xx1.jpg",...,"https://xxn.jpg"],"total_pixels": 134217728}
object(Optional)Ativa o cache explícito. Para mais informações, consulte Explicit caching.Propriedades
typestring(Required)Apenasephemeralé suportado.string(Required)Função da mensagem do usuário. O valor é fixo comouser.object(Optional)Resposta do modelo. Normalmente é transmitida de volta ao modelo como contexto em uma conversa de múltiplas rodadas.Tool MessagePropriedades
contentstring(Optional)Conteúdo de texto da resposta do modelo. Quandotool_callsestá incluído,contentpode estar vazio. Caso contrário,contenté obrigatório.rolestring(Required)Função da mensagem do assistente. O valor é fixo comoassistant.partialboolean(Optional) Valor padrão:falseEspecifica se o modo parcial deve ser ativado.Valores válidos:- true: Ativar.
- false: Desativar.
array(Optional)Informações sobre a ferramenta e seus parâmetros de entrada que o modelo decide chamar. Contém um ou mais objetos e é obtido do campotool_callsda resposta anterior do modelo.Propriedades
idstring(Required)ID da chamada de ferramenta.typestring(Required)Tipo da ferramenta. Atualmente, apenasfunctioné suportado.functionobject(Required)Ferramentas e parâmetros de entradaindexPropriedades
namestring(Required)Nome da ferramenta.argumentsstring(Required)Informações do parâmetro de entrada, como uma string formatada em JSON.integer(Required)Índice desta chamada de ferramenta no arraytool_calls.object(Optional)Resultado da chamada de ferramenta.Propriedades
contentstring(Required)Conteúdo de saída da função da ferramenta. Deve ser uma string. Se a ferramenta retornar dados estruturados, como JSON, eles devem ser serializados em uma string.rolestring(Required)O valor é fixo comotool.tool_call_idstring(Required)ID da chamada de ferramenta à qual esta mensagem responde. Obtenha-o emcompletion.choices[0].message.tool_calls[$index].id. Este ID associa a mensagem da ferramenta à chamada de ferramenta correspondente.stream boolean(Optional) Valor padrão:falseEspecifica se a resposta deve ser em modo de saída streaming. Para mais informações, consulte Streaming output.Valores válidos:false: O modelo retorna o conteúdo completo após a conclusão da geração.true: O modelo gera o conteúdo conforme ele é produzido. Um chunk de dados é retornado cada vez que uma parte do conteúdo é gerada. Leia esses chunks para montar a resposta completa.
truepara melhorar a experiência do usuário e reduzir o risco de timeouts.Para chamadas sem streaming, o timeout máximo é de pelo menos 300 segundos e varia conforme a região e o modelo. Se não for concluído a tempo, o service interrompe a solicitação e retorna o conteúdo gerado em vez de um erro. Recomendamos o uso de chamadas com streaming para cenários que exigem saídas longas. Para mais informações, consulte a descrição de timeout em Overview of text generation models.stream_options object(Optional)Itens de configuração para saída streaming. Este parâmetro só tem efeito quandostreamestá definido comotrue.Propriedades
include_usageboolean(Optional) Valor padrão:falseEspecifica se as informações de consumo de tokens devem ser incluídas no último chunk de dados da resposta.Valores válidos:true: Incluir.false: Não incluir.
Para saída streaming, as informações de consumo de tokens só podem aparecer no último chunk de dados da resposta.
modalities array(Optional) Valor padrão:["text"]Modalidade dos dados de saída. Este parâmetro se aplica apenas aos modelos Qwen-Omni. Para mais informações, consulte Non-real-time (Qwen-Omni).Valores válidos:["text","audio"]: Saída de texto e áudio.["text"]: Apenas saída de texto.
audio object(Optional)Voz e formato do áudio de saída. Este parâmetro se aplica apenas aos modelos Qwen-Omni e exige que o parâmetromodalitiesesteja definido como["text","audio"]. Para mais informações, consulte Non-real-time (Qwen-Omni).Propriedades
voicestring(Required)Voz do áudio de saída. Para mais informações, consulte Non-real-time (Qwen-Omni).formatstring(Required)Formato do áudio de saída. Apenaswavé suportado.temperature float(Opcional)Temperatura de amostragem que controla a diversidade do texto gerado pelo modelo.Valores mais altos resultam em textos mais diversos, enquanto valores mais baixos produzem textos mais determinísticos.Intervalo de valores: [0, 2)Tanto temperature quanto top_p controlam a diversidade do texto gerado. Recomendamos definir apenas um deles. Para mais informações, consulte Overview.Não modifique o valor padrão de temperature para modelos QVQ.
top_p float(Opcional)Limiar de probabilidade para amostragem de núcleo, responsável por controlar a diversidade do texto gerado pelo modelo.Um top_p mais alto gera textos mais diversos. Um top_p mais baixo resulta em textos mais determinísticos.Intervalo de valores: (0, 1.0]Tanto temperature quanto top_p influenciam a diversidade do texto gerado. Recomendamos configurar apenas um desses parâmetros. Para mais detalhes, consulte Overview.Não modifique o valor padrão de top_p para modelos QVQ.
top_k integer(Opcional)Define o número de tokens candidatos para amostragem durante a geração. Valores maiores aumentam a aleatoriedade da saída, enquanto valores menores tornam a saída mais determinística. Se definido comonullou superior a 100, a estratégiatop_ké desativada e apenas a estratégiatop_pentra em vigor. O valor deve ser um número inteiro maior ou igual a 0.Valores padrão de top_k
Série QVQ: 10;Série QwQ: 40;modelos anteriores à série qwen-vl-plus, e qwen2.5-omni-7b: 1;Série Qwen3-Omni-Flash: 50;Demais modelos: 20.Série GLM (fornecida pela Alibaba Cloud): 20;As séries DeepSeek, Kimi e MiniMax não suportam o parâmetro top_k.Este não é um parâmetro padrão da OpenAI. Ao chamar usando o SDK Python, inclua-o no objeto extra_body. Configuração: extra_body={"top_k":xxx}.
Não altere o valor padrão de top_k para modelos QVQ.
repetition_penalty float(Opcional)Penalidade de repetição aplicada a sequências consecutivas durante a geração do modelo. Aumentar repetition_penalty reduz a repetição na saída. O valor 1.0 indica ausência de penalidade. Não há intervalo estrito, desde que o valor seja maior que 0.Este não é um parâmetro padrão da OpenAI. Ao chamar usando o SDK Python, inclua-o no objeto extra_body. Configuração: extra_body={"repetition_penalty":xxx}.
Ao usar o modelo qwen-vl-plus_2025-01-25 para extração de texto, defina repetition_penalty como 1.0.
Mantenha o valor padrão de repetition_penalty para modelos QVQ.
presence_penalty float(Opcional)Controla a repetição de conteúdo quando o modelo gera texto.Intervalo de valores: [-2.0, 2.0]. Valores positivos diminuem a repetição, enquanto valores negativos a aumentam.Aumente este valor em cenários que exigem diversidade, diversão ou criatividade, como escrita criativa ou brainstorming. Diminua o valor em contextos que priorizam consistência e precisão terminológica, como documentos técnicos ou textos formais.Valores padrão de presence_penalty
Qwen3.8 (modo sem pensamento), Qwen3.7 (modo sem pensamento), Qwen3.6 (modo sem pensamento), Qwen3.5-Omni, Qwen3.5 (modo sem pensamento), qwen3-max-preview (modo de pensamento), Qwen3 (modo sem pensamento), série Qwen3-Instruct/1.7b/4b (modo de pensamento), série QVQ, qwen-max, série qwen2.5-vl, série qwen-vl-max, qwen-vl-plus, Qwen3-VL (sem pensamento): 1.5;qwen3-8b/14b/32b/30b-a3b/235b-a22b (modo de pensamento), qwen-plus/qwen-plus-latest/2025-04-28 (modo de pensamento), qwen-turbo/qwen-turbo/2025-04-28 (modo de pensamento): 0.5;Todos os demais: 0.0.Série DeepSeek (fornecida pela Alibaba Cloud): deepseek-r1, deepseek-r1-0528, versão destilada deepseek-r1-distill-qwen: 1;Série Kimi (fornecida pela Alibaba Cloud): kimi-k2.7-code, kimi-k2.6, kimi-k2.5: 0.0;Série Kimi (fornecida pela Moonshot AI): 0.0;Série MiniMax (fornecida pela Alibaba Cloud): MiniMax-M2.5, MiniMax-M2.1: 0.0;Outros modelos DeepSeek, Kimi, GLM e MiniMax não possuem valor padrão.Como funciona
Se o valor do parâmetro for positivo, o modelo aplica uma penalidade aos tokens já presentes no texto. Essa penalidade independe da frequência de aparição do token. Isso reduz a probabilidade de reaparecimento desses tokens, diminuindo a repetição de conteúdo e aumentando a diversidade vocabular.Exemplo
Prompt: Traduza esta frase para chinês: "This movie is good. The plot is good, the acting is good, the music is good, and overall, the whole movie is just good. It is really good, in fact. The plot is so good, and the acting is so good, and the music is so good."Valor do parâmetro 2.0: This movie is great. The plot is fantastic, the acting is superb, and the music is also very beautiful. Overall, the entire film is just incredible. It is actually truly outstanding. The storyline is very exciting, the performances are excellent, and the soundtrack is so moving.Valor do parâmetro 0.0: This movie is good. The plot is good, the acting is good, and the music is good. Overall, the whole movie is very good. In fact, it is really great. The plot is very good, the acting is also very excellent, and the music is equally outstanding.Valor do parâmetro -2.0: This movie is good. The plot is good, the acting is good, and the music is good. Overall, the whole movie is good. In fact, it is really good. The plot is very good, the acting is very good, and the music is very good.Ao utilizar o modelo qwen-vl-plus para extração de texto, configure presence_penalty como 1.5.
Evite alterar o valor padrão de presence_penalty em modelos QVQ.
response_format object(Opcional) Valor padrão:{"type": "text"}Formato da resposta. Valores válidos:{"type": "text"}: Gera uma resposta em texto.{"type": "json_object"}: Produz uma string formatada em JSON padrão.{"type": "json_schema", "json_schema": {...}}: Produz uma string JSON estritamente em conformidade com o JSON Schema especificado, o que permite controlar com precisão a estrutura da saída e os tipos dos campos.
Para mais informações, consulte Structured output. Os modos
json_objectejson_schemasão compatíveis com modelos diferentes. Para mais informações, consulte Supported models.Caso especifique
{"type": "json_object"}, instrua explicitamente o modelo a gerar JSON no prompt, por exemplo: "Por favor, responda em formato JSON". Caso contrário, ocorrerá um erro. Caso especifique{"type": "json_schema", ...}, o prompt não precisa conter a palavra-chave JSON.Propriedades
typestring(Obrigatório)Formato do conteúdo retornado. Valores válidos:text: Retorna uma resposta em texto.json_object: Retorna uma string formatada em JSON padrão.json_schema: Retorna uma string JSON estritamente em conformidade com a estrutura definida no campojson_schema.
object(Opcional)Obrigatório quandotypeéjson_schema. Define a estrutura JSON que a saída do modelo deve seguir. Para mais informações, consulte Obtendo saída estruturada.Ao usar o método
parsedo SDK da OpenAI, você pode passar diretamente uma classe Pydantic do Python ou um objeto Zod do Node.js. O SDK converte automaticamente para JSON Schema, sem necessidade de construí-lo manualmente.Propriedades
namestring(Obrigatório)O nome do schema.schemaobject(Obrigatório)O objeto JSON Schema que descreve a estrutura da saída. Usepropertiespara definir a estrutura dos campos,requiredpara listar os campos obrigatórios eadditionalPropertiespara controlar se campos não definidos no schema podem ser retornados. Recomendamos definiradditionalPropertiescomofalse, para que apenas os campos definidos sejam retornados. Tipos de dados compatíveis: string, number, integer, boolean, object, array e enum. Para mais informações, consulte Guia de configuração.strictboolean(Opcional)Indica se a estrutura definida porschemadeve ser seguida estritamente. Recomendamos definir este parâmetro comotrue.max_tokens integer(Opcional, será descontinuado)Este parâmetro será descontinuado. Para novas integrações, utilize
O significado deste parâmetro varia conforme o modelo:max_completion_tokens.- deepseek-v4-pro, deepseek-v4-pro-0813, deepseek-v4-flash, deepseek-v4-flash-0731: Número máximo de tokens para a soma da resposta do modelo e do conteúdo da cadeia de pensamento. Se a saída exceder esse valor, a geração é interrompida antecipadamente e o
finish_reasonretornado élength. - glm-5.2: Quando o parâmetro
thinking_budgetnão é informado,max_tokensrepresenta o limite máximo de tokens para a soma da resposta e da cadeia de pensamento; se ultrapassado, a geração para precocemente comfinish_reasonigual alength. Ao informarthinking_budget,max_tokenslimita apenas a resposta do modelo, enquanto os tokens da cadeia de pensamento são controlados separadamente porthinking_budget. - Outros modelos: Limite máximo de tokens para a resposta do modelo. Caso o conteúdo gerado ultrapasse esse valor, a geração cessa prematuramente e o
finish_reasonretornado serálength.
max_completion_tokens integer(Opcional)Comprimento máximo da saída do modelo, abrangendo tanto a cadeia de pensamento quanto a resposta final. Se a saída superar esse limite, a geração é interrompida e ofinish_reasonretornado élength.Tanto o valor padrão quanto o máximo equivalem ao comprimento máximo de saída suportado pelo modelo.Diferença em relação amax_tokens:max_completion_tokensrestringe a saída completa (cadeia de pensamento + resposta), ao passo quemax_tokenslimita apenas a parte da resposta. Para modelos de pensamento, recomendamos o uso demax_completion_tokens.Modelos compatíveis:- Qwen Max: Qwen3.7-Max e posteriores
- Qwen Plus: Qwen3.5-Plus e posteriores
- Qwen Flash: Qwen3.5-Flash e posteriores
- Kimi: kimi-k2.5 e posteriores
- GLM: glm-5 e posteriores
- MiniMax: MiniMax-M2.5 e posteriores
- DeepSeek: deepseek-v3, deepseek-r1, deepseek-r1-0528, deepseek-v3.1, deepseek-v3.2, deepseek-v3.2-exp, deepseek-v4-pro, deepseek-v4-flash e posteriores
A lista acima não inclui modelos fornecidos diretamente por terceiros.
Pode haver uma diferença de até 10 tokens entre a contagem real de tokens de saída e o valor especificado em
max_completion_tokens.vl_high_resolution_images boolean(Opcional) Valor padrão:falseDefine se o limite de pixels das imagens de entrada deve ser elevado para a quantidade correspondente a 16384 tokens. Para mais detalhes, consulte Processing high-resolution images.-
vl_high_resolution_images: trueadota uma estratégia de resolução fixa e ignora a configuraçãomax_pixels. Se a resolução for excedida, a contagem total de pixels da imagem é reduzida proporcionalmente para permanecer dentro desse limite.Clique para ver os limites de pixels de cada modelo
Quandovl_high_resolution_imageséTrue, os limites de pixels variam conforme o modelo:- Para as séries Qwen3.8, Qwen3.7, Qwen3.6,
Qwen3.5,Qwen3-VL,qwen-vl-max,qwen-vl-max-0813,qwen-vl-plus,qwen-vl-plus-0815e modelos , o valor é16777216. (CadaTokencorresponde a32 32pixels. O valor total é calculado como1638432*32.) Série QVQe demais modelos dasérie Qwen2.5-VL:12845056(1tokenequivale a28 28pixels, totalizando1638428*28)
- Para as séries Qwen3.8, Qwen3.7, Qwen3.6,
-
Com
vl_high_resolution_imagesdefinido comofalse, o limite de pixels segue a configuração demax_pixels. Se a contagem de pixels da imagem de entrada ultrapassarmax_pixels, a imagem é redimensionada para ficar dentro do limite demax_pixels. O limite padrão de pixels de cada modelo corresponde ao valor padrão demax_pixels.
Este não é um parâmetro padrão da OpenAI. Ao chamar usando o SDK Python, inclua-o no objeto extra_body. Configuração: extra_body={"vl_high_resolution_images":xxx}.
n integer(Opcional) Valor padrão: 1Quantidade de respostas a serem geradas. O intervalo válido é1-4. Ideal para cenários que demandam múltiplas respostas candidatas, como escrita criativa ou textos publicitários.Compatível apenas com Qwen3 (non-thinking mode).
Se o parâmetro
toolsfor utilizado, definancomo 1.Aumentar n eleva o consumo de tokens de saída, mas não afeta o consumo de tokens de entrada.
enable_thinking boolean(Opcional)Em modelos de pensamento misto, que operam nos modos com e sem pensamento, este parâmetro ativa o modo de pensamento. Aplica-se aos modelos Qwen3.7, Qwen3.6, Qwen3.5, Qwen3, Qwen3-Omni-Flash e Qwen3-VL, além das séries DeepSeek-V4-Pro/V4-Flash, DeepSeek-V3.2/V3.2-exp/V3.1, Kimi-K2.7-code (apenas modelo de pensamento), séries Kimi-K2.6/K2.5 e série GLM. A série DeepSeek-V4 já vem com o pensamento ativado por padrão. É possível ajustar a intensidade da inferência através do parâmetroreasoning_effort.Valores válidos:-
true: AtivarQuando ativado, o conteúdo do pensamento é retornado no campo
reasoning_content. -
false: Desativar
Este não é um parâmetro padrão da OpenAI. Ao chamar usando o SDK Python, inclua-o no objeto extra_body. Configuração:
extra_body={"enable_thinking": xxx}.Em chamadas HTTP diretas (por exemplo, via curl) sem o SDK da OpenAI, não utilize
extra_body. Insiraenable_thinkingno nível superior do corpo da requisição (body), ao lado de parâmetros comomodelemessages, por exemplo:"enable_thinking": true.Os modelos MiniMax e MiniMax-M3 da Xiyu Technology não utilizam este parâmetro. Utilize o parâmetro
thinkingem seu lugar.thinking object(Opcional) Valor padrão:{"type":"adaptive"}Gerencia o modo de pensamento dos modelos MiniMax/MiniMax-M3 fornecidos pela MiniMax.Valores válidos parathinking.type:adaptive: Automático (padrão). O modelo decide se deve pensar.disabled: Desativa o pensamento e responde diretamente.
Este não é um parâmetro padrão da OpenAI. Ao chamar usando o SDK Python, inclua-o no objeto extra_body. Configuração:
extra_body={"thinking": {"type": "adaptive"}}.preserve_thinking boolean(Opcional) Valor padrão:false(Valor padrão para qwen3.8-max:true)Indica se o reasoning_content das mensagens do assistente no histórico da conversa deve ser anexado à entrada do modelo. Indicado para situações em que o modelo precisa consultar o processo de pensamento anterior.Atualmente compatível com qwen3.7-max, qwen3.7-max-2026-05-20 e snapshots subsequentes, qwen3.6-max-preview, qwen3.7-plus, qwen3.7-plus-2026-05-26, qwen3.6-plus, qwen3.6-plus-2026-04-02, qwen3.8-flash, qwen3.7-flash, qwen3.7-flash-2026-07-15, qwen3.6-flash, qwen3.6-flash-2026-04-16, qwen3.8-max (ativado por padrão), kimi-k2.6 (implantado no Alibaba Cloud Model Studio), kimi-k2.7-code (implantado no Alibaba Cloud Model Studio, ativado por padrão), kimi/kimi-k2.7-code-highspeed (fornecido pela Moonshot AI, ativado por padrão) e kimi/kimi-k2.7-code (fornecido pela Moonshot AI, ativado por padrão).Importante (qwen3.8-max): No qwen3.8-max, preserve_thinking é true por padrão. Envie todo o reasoning_content histórico no campo reasoning_content. NÃO concatene reasoning_content no campo content. Essa prática pode degradar o desempenho do modelo.
- Se as mensagens históricas não possuírem reasoning_content, ativar este parâmetro não causará erros.
- Quando ativado, o reasoning_content da conversa histórica integra a contagem de tokens de entrada e é faturado.
Este não é um parâmetro padrão da OpenAI. Ao chamar usando o SDK Python, inclua-o no objeto extra_body. Configuração:
extra_body={"preserve_thinking": True}.thinking_budget integer(Opcional)Número máximo de tokens destinados ao processo de pensamento. Aplica-se aos modelos Qwen3.8, Qwen3.7, Qwen3.6, Qwen3.5, Qwen3-VL, Qwen3, GLM e Kimi, exceto kimi-k3, que não suporta este parâmetro. Para mais informações, consulte Limit thinking length.O valor padrão corresponde ao comprimento máximo da cadeia de pensamento do modelo. Consulte a lista de modelos para mais detalhes.Este não é um parâmetro padrão da OpenAI. Ao chamar usando o SDK Python, inclua-o no objeto extra_body. Configuração:
extra_body={"thinking_budget": xxx}.reasoning_effort string(Opcional)Regula a intensidade da inferência dos modelos. Os valores válidos e padrões variam conforme o modelo.Séries DeepSeek-V4 e GLM (Valor padrão:high)Valores válidos:high: Inferência de alta intensidademax: Inferência de intensidade máxima
maxValores válidos:max(padrão): raciocínio profundohigh: raciocínio aprimoradolow: raciocínio leve
enable_thinkingaceita apenastrue. Enviarfalsecausará falha na requisição da API.deepseek-v4-flash-0731 & deepseek-v4-pro-0813: Valor padrão:highValores válidos:max(padrão): Inferência de intensidade máximahigh: Inferência padrãolow: Inferência de baixa intensidade
mediumé mapeado para high,xhighé mapeado para high.kimi/kimi-k3 (Valor padrão:max; apenasmaxé suportado)Valor válido:max: Inferência de intensidade máxima
xhighValores válidos:xhigh(padrão): Inferência de intensidade máximamedium: Inferência padrãolow: Inferência de baixa intensidade
maxé mapeado para xhigh,highé mapeado para xhigh,minimalé mapeado para low, enoneé mapeado para enable_thinking=False.Definir valores diferentes dos válidos ou mapeados acima resultará em erro.
Na série qwen3.8, reasoning_effort e thinking_budget não podem ser configurados simultaneamente. Definir ambos gerará um erro. Contudo, eles permitem conversão mútua:- Sem thinking_budget definido, os níveis de reasoning_effort são mapeados automaticamente para thinking_budget:
lowcorresponde a 4096,mediumcorresponde a 16384 exhighcorresponde a 262144. - Sem reasoning_effort definido, thinking_budget é convertido automaticamente para reasoning_effort: 0–4096 corresponde a
low, 4097–16384 corresponde amediume 16385–262144 corresponde axhigh. - Se nenhum dos dois for definido, utilizam-se o thinking_budget padrão (131072) e o reasoning_effort padrão (xhigh).
Este não é um parâmetro padrão da OpenAI. Ao chamar usando o SDK Python, inclua-o no objeto extra_body. Configuração:
extra_body={"reasoning_effort": "high"}.tool_stream boolean(Opcional) Valor padrão:falseTem efeito apenas quandostream=true. Atualmente, esse parâmetro é compatível somente com as séries Qwen e GLM.Lista de compatibilidade da série Qwen:- Série qwen-max: modalidade de texto das séries qwen3.8-max e qwen3.7-max
- Série qwen-plus: modalidade de texto das séries qwen3.7-plus e qwen3.6-plus, além da modalidade omni da série qwen3.5-plus
- Série qwen-flash: modalidade omni das séries qwen3.8-flash, qwen3.7-flash, qwen3.6-flash e qwen3.5-flash
tool_streamafeta apenas parâmetros de ferramentas complexas. Para parâmetros normais, a saída em streaming é ativada desde questream=true. Ferramentas complexas são aquelas cuja definição contém tipos de parâmetro comoarrayouobject.tool_stream=false: Os parâmetros de ferramentas complexas são gerados de uma só vez. Esse é o comportamento padrão e oferece maior precisão para formatos complexos.tool_stream=true: Os parâmetros de ferramentas complexas são gerados em streaming, o que evita riscos de timeout em formatos complexos.
tool_stream=false: Os parâmetros da ferramenta são gerados de uma só vez. Esse é o comportamento padrão e oferece maior precisão para formatos complexos.tool_stream=true: Os parâmetros da ferramenta são gerados em streaming, o que evita riscos de timeout em formatos complexos.
Este parâmetro não é um parâmetro padrão da OpenAI. Ao chamar usando o Python SDK, coloque-o no objeto extra_body. Configuração:
extra_body={"tool_stream": true}.enable_code_interpreter boolean(Opcional) Valor padrão:falseDefine se o recurso de interpretador de código deve ser ativado. Para mais informações, consulte Code interpreter.Valores válidos:true: Ativarfalse: Desativar
Este parâmetro não é um parâmetro padrão da OpenAI. Ao chamar usando o Python SDK, coloque-o no objeto extra_body. Configuração:
extra_body={"enable_code_interpreter": xxx}.seed integer(Opcional)Semente de número aleatório. Utilize este parâmetro para garantir resultados reproduzíveis com a mesma entrada e os mesmos parâmetros. Se você passar o mesmo valor deseedem uma chamada e os demais parâmetros permanecerem inalterados, o modelo retornará o mesmo resultado sempre que possível.Intervalo de valores:[0,2<sup>31</sup>−1].logprobs boolean(Opcional) Valor padrão:falseDetermina se as probabilidades logarítmicas dos tokens de saída devem ser retornadas. Valores válidos:-
trueRetornar -
falseNão retornar
O conteúdo gerado durante a fase de raciocínio (
reasoning_content) não retorna probabilidades logarítmicas.Modelos compatíveis
- Modelos snapshot da série qwen-plus (exceto versões estáveis)
- Modelos snapshot da série qwen-turbo (exceto versões estáveis)
- Modelos da série qwen3-vl-plus (incluindo versões estáveis)
- Modelos da série qwen3-vl-flash (incluindo versões estáveis)
- Modelos open source do Qwen3
top_logprobs integer(Opcional) Valor padrão: 0Especifica a quantidade de tokens candidatos mais prováveis a serem retornados em cada etapa de geração.Intervalo de valores: [0, 5]Esse parâmetro só tem efeito quandologprobsétrue.stop string or array(Opcional)Utilizado para definir palavras de parada. Quando uma string outoken_idespecificado emstopaparece no texto gerado, a geração é interrompida imediatamente.É possível passar palavras sensíveis para controlar a saída do modelo.Quando stop for um array, não é permitido combinar
token_ide strings como elementos. Por exemplo, não especifique["Hello",104307].tools array(Opcional)Um array contendo um ou mais objetos de ferramenta que o modelo pode chamar via Function Calling. Para mais informações, consulte Function calling.Setoolsestiver definido e o modelo determinar que uma ferramenta precisa ser chamada, a resposta retornará as informações da ferramenta emtool_calls.Propriedades
typestring(Obrigatório)Tipo da ferramenta. Atualmente, apenasfunctioné suportado.functionobject(Obrigatório)Propriedades
namestring(Obrigatório)Nome da ferramenta. São permitidos apenas letras, números, sublinhados (_) e hifens (-). O comprimento máximo é de 64 tokens.descriptionstring(Obrigatório)Descrição da ferramenta, que auxilia o modelo a decidir quando e como chamá-la.parametersobject(Opcional) Valor padrão:{}Descrição dos parâmetros da ferramenta, que deve ser um JSON Schema válido. Para detalhes sobre JSON Schema, consulte este link. Se o parâmetroparametersestiver vazio, a ferramenta não possui parâmetros de entrada, como ocorre em uma ferramenta de consulta de hora.Para melhorar a precisão das chamadas de ferramenta, recomendamos passar
parameters.tool_choice string or object(Opcional) Valor padrão:autoEstratégia de seleção de ferramentas. Defina este parâmetro para forçar um método específico de chamada de ferramenta para determinado tipo de problema, como usar sempre uma ferramenta específica ou desativar todas as ferramentas.Valores válidos:-
autoO modelo de linguagem grande escolhe a estratégia de ferramenta. -
noneSe não quiser chamar nenhuma ferramenta, defina o parâmetrotool_choicecomonone. -
{"type": "function", "function": {"name": "the_function_to_call"}}Para forçar a chamada de uma ferramenta específica, defina o parâmetrotool_choicecomo{"type": "function", "function": {"name": "the_function_to_call"}}, ondethe_function_to_callé o nome da função da ferramenta especificada.Modelos em modo de raciocínio não suportam a imposição de chamada de uma ferramenta específica.
parallel_tool_calls boolean(Opcional) Valor padrão:falseDefine se a chamada paralela de ferramentas deve ser ativada. Para mais informações, consulte Parallel tool calling.Valores válidos:true: Ativarfalse: Desativar
enable_search boolean(Opcional) Valor padrão:falseDefine se a busca na web deve ser ativada. Para mais informações, consulte Web search.Valores válidos:-
true: Ativar.Se a busca na web não for executada após a ativação, otimize o prompt ou defina o parâmetro
forced_searchemsearch_optionspara habilitar a busca forçada. -
false: Desativar.
Ativar o recurso de busca na web pode aumentar o consumo de tokens.
Este parâmetro não é um parâmetro padrão da OpenAI. Ao chamar usando o Python SDK, coloque-o no objeto extra_body. Configuração:
extra_body={"enable_search": True}.search_options object(Opcional)Estratégia para busca na web. Para mais informações, consulte Web search.Propriedades
forced_searchboolean(Opcional) Valor padrão:falseDefine se a busca na web deve ser forçada. Este parâmetro só tem efeito quandoenable_searchestá definido comotrue.Valores válidos:- true: Forçar ativação.
- false: Não forçar ativação. O modelo decide se realiza a busca na web.
string(Opcional) Valor padrão:turboEstratégia de busca. Este parâmetro só tem efeito quandoenable_searchestá definido comotrue.Valores válidos:-
turbo(Padrão): Equilibra velocidade de resposta e eficácia da busca. Adequado para a maioria dos cenários. -
max: Adota uma estratégia de busca mais abrangente. Pode acionar motores de busca de múltiplas fontes para obter resultados mais detalhados, mas o tempo de resposta pode ser maior. -
agent: Permite chamar a ferramenta de busca na web e o modelo de linguagem grande várias vezes para realizar recuperação de informações em múltiplas turnos e integração de conteúdo.Esta estratégia aplica-se apenas a qwen3.5-plus, qwen3.5-plus-2026-02-15, qwen3.5-flash, qwen3.5-flash-2026-02-23, qwen3-max, qwen3-max-2026-01-23, qwen3-max-2025-09-23, qwen3.5-omni-plus, qwen3.5-omni-plus-2026-03-15, qwen3.5-omni-flash e qwen3.5-omni-flash-2026-03-15.
-
agent_max: Suporta web scraping baseado na estratégiaagent. Para mais informações, consulte Web scraping.Esta estratégia aplica-se apenas ao modo de raciocínio do qwen3-max e qwen3-max-2026-01-23.
boolean(Opcional) Valor padrão:falseDefine se a busca vertical deve ser ativada. Este parâmetro só tem efeito quandoenable_searchestá definido comotrue.Valores válidos:true: Ativar.false: Desativar.
Este parâmetro não é um parâmetro padrão da OpenAI. Ao chamar usando o Python SDK, coloque-o no objeto extra_body. Configuração:
extra_body={"search_options": xxx}.clear_thinking boolean(Opcional) Valor padrão: falseControla se oreasoning_content(processo de raciocínio) de turnos anteriores em uma conversa de múltiplos turnos é usado como entrada de contexto para o modelo. Este parâmetro é compatível apenas com os modelos da série GLM: glm-5.2, glm-5.1, glm-5 e glm-4.7.Este parâmetro não é um parâmetro padrão da OpenAI. Ao chamar usando o Python SDK, coloque-o no objeto extra_body. Configuração:
extra_body={"skill": [...]}.true: Ignora oreasoning_contentde turnos anteriores e usa apenas texto visível, chamadas de ferramenta, resultados e outro conteúdo não inferencial como entrada de contexto. Isso reduz o tamanho do contexto e o custo.false(Padrão): Mantém oreasoning_contentde turnos anteriores e o fornece ao modelo junto com o contexto. Para ativar o Pensamento Preservado, você deve passar oreasoning_contenthistórico completo, sem modificações e na ordem original dentro das mensagens. A ausência, corte, reescrita ou reordenação degrada o desempenho ou causa falhas.
Objeto de resposta de chat (saída não streaming)
id stringIdentificador exclusivo desta chamada.choices arrayArray com o conteúdo gerado pelo modelo.Properties
finish_reasonstringMotivo pelo qual o modelo interrompeu a geração.Considere os três cenários a seguir:stop: O modelo parou porque acionou o parâmetrostopna entrada ou finalizou naturalmente.length: A geração foi interrompida por exceder o comprimento máximo.tool_calls: O modelo parou pois precisa chamar uma ferramenta.
integerÍndice deste objeto no arraychoices.logprobsobjectInformações sobre a probabilidade dos tokens na saída do modelo.messageProperties
contentarrayArray contendo cada token e sua respectiva probabilidade logarítmica.Properties
tokenstringTexto do token atual.bytesarrayLista dos bytes UTF-8 brutos do token atual. Útil para restaurar com precisão o conteúdo de saída, como emojis ou caracteres chineses.logprobfloatProbabilidade logarítmica do token atual. Um valor de retornonullindica probabilidade extremamente baixa.top_logprobsarrayTokens candidatos mais prováveis na posição do token atual. A quantidade de tokens corresponde ao parâmetro de solicitaçãotop_logprobs. Cada elemento contém:Properties
tokenstringTexto do token candidato.bytesarrayLista dos bytes UTF-8 brutos do token atual. Útil para restaurar com precisão o conteúdo de saída, como emojis ou caracteres chineses.logprobfloatProbabilidade logarítmica deste token candidato. Um valor nulo indica probabilidade extremamente baixa.objectMensagem produzida pelo modelo.Properties
contentstringConteúdo da resposta do modelo.reasoning_contentstringConteúdo da cadeia de pensamento do modelo.refusalstringAtualmente, este parâmetro é fixo comonull.rolestringFunção da mensagem. O valor é fixo comoassistant.audioobjectAtualmente, este parâmetro é fixo comonull.function_call (a ser descontinuado)objectEste valor é fixo comonull. Para mais informações, consulte o parâmetrotool_calls.tool_callsarrayInformações sobre a ferramenta e seus parâmetros de entrada que o modelo decidiu chamar.Properties
idstringIdentificador exclusivo desta chamada de ferramenta.typestringTipo da ferramenta. Atualmente, apenasfunctioné suportado.functionobjectDetalhes da ferramentaindexProperties
namestringNome da ferramenta.argumentsstringInformações dos parâmetros de entrada, formatadas como uma string JSON.Como a resposta do modelo de linguagem grande é aleatória, as informações dos parâmetros de saída podem não estar em conformidade com a assinatura da função. Valide os parâmetros antes de chamar a função.
integerÍndice desta chamada de ferramenta no arraytool_calls.created integerTimestamp Unix, em segundos, indicando quando a solicitação foi criada.model stringModelo utilizado nesta solicitação.object stringO valor é semprechat.completion.service_tier stringAtualmente, este parâmetro é fixo comonull.system_fingerprint stringAtualmente, este parâmetro é fixo comonull.usage objectInformações sobre o consumo de tokens nesta solicitação.Properties
completion_tokensintegerQuantidade de tokens na saída do modelo.prompt_tokensintegerNúmero de tokens de entrada. Para mais informações, consulte Additional notes.total_tokensintegerTotal de tokens consumidos. Corresponde à soma deprompt_tokensecompletion_tokens.completion_tokens_detailsobject(Opcional)Classificação detalhada dos tokens de saída. Este campo é retornado apenas por alguns modelos.prompt_tokens_detailsProperties
audio_tokensinteger(Opcional)Número de tokens de áudio na saída. Retornado apenas para modelos com saída de áudio.reasoning_tokensinteger(Opcional)Quantidade de tokens no processo de raciocínio. Retornado apenas para modelos de raciocínio.text_tokensinteger(Opcional)Número de tokens no texto de saída.objectClassificação detalhada dos tokens de entrada.Properties
audio_tokensintegerAtualmente, este parâmetro é fixo comonull.cached_tokensintegerNúmero de tokens que atingiram o cache. Para mais informações sobre o Context Cache, consulte Context cache.text_tokensintegerQuantidade de tokens de texto na entrada.image_tokensintegerNúmero de tokens de imagem na entrada.video_tokensintegerQuantidade de tokens referentes ao arquivo de vídeo ou lista de imagens de entrada.cache_creationobjectInformações de criação do explicit cache.cache_creation_input_tokensProperties
ephemeral_5m_input_tokensintegerNúmero de tokens usados para criar o cache explícito.integerQuantidade de tokens utilizados na criação do cache explícito.cache_typestringAo usar explicit cache, o valor do parâmetro éephemeral. Caso contrário, este parâmetro não existe.Objeto de chunk de resposta de chat (saída streaming)
id stringIdentificador exclusivo desta chamada. Todos os objetos de chunk compartilham o mesmo ID.choices arrayArray com o conteúdo gerado pelo modelo, podendo conter um ou mais objetos. Se o parâmetroinclude_usageestiver definido comotrue,choicesserá um array vazio no último chunk.Properties
deltaobjectObjeto incremental da solicitação.finish_reasonProperties
contentstringConteúdo incremental da mensagem.reasoning_contentstringConteúdo incremental da cadeia de pensamento.function_callobjectEste valor tem como padrãonull. Para mais informações, consulte o parâmetrotool_calls.audioobjectResposta gerada ao utilizar o modelo Qwen-Omni.refusalProperties
datastringDados de áudio incrementais codificados em Base64.expires_atintegerTimestamp indicando quando a solicitação foi criada.objectAtualmente, este parâmetro é fixo comonull.rolestringFunção do objeto de mensagem incremental. Possui valor apenas no primeiro chunk.tool_callsarrayInformações sobre a ferramenta e seus parâmetros de entrada que o modelo decidiu chamar.Properties
indexintegerÍndice desta chamada de ferramenta no arraytool_calls.idstringIdentificador exclusivo desta chamada de ferramenta.functionobjectInformações sobre a ferramenta chamada.typeProperties
argumentsstringParâmetros de entrada incrementais. Osargumentsde todos os chunks são concatenados para formar o conjunto completo de parâmetros de entrada.Como a resposta do modelo de linguagem grande é aleatória, as informações dos parâmetros de saída podem não estar em conformidade com a assinatura da função. Valide os parâmetros antes de chamar a função.
namestringNome da ferramenta. Possui valor apenas no primeiro chunk.stringTipo da ferramenta. Atualmente, apenasfunctioné suportado.stringMotivo pelo qual o modelo interrompeu a geração. O valor pode ser um dos seguintes:stop: O modelo parou porque acionou o parâmetrostopna entrada ou finalizou naturalmente.- O valor permanece
nullaté que a geração seja concluída. length: A geração foi interrompida por exceder o comprimento máximo.tool_calls: O modelo parou pois precisa chamar uma ferramenta.
integerÍndice da resposta atual no arraychoices. Quando o parâmetro de entrada n for maior que 1, utilize este parâmetro para concatenar o conteúdo completo correspondente às diferentes respostas.logprobsobjectInformações de probabilidade do objeto atual.Properties
contentarrayArray de tokens com informações de probabilidade logarítmica.Properties
tokenstringToken atual.bytesarrayLista dos bytes UTF-8 brutos do token atual. Útil ao processar emojis e caracteres chineses.logprobfloatProbabilidade logarítmica do token atual. Um valor nulo indica probabilidade extremamente baixa.top_logprobsarrayTokens mais prováveis na posição do token atual e suas probabilidades logarítmicas. A quantidade de elementos corresponde ao parâmetro de entradatop_logprobs.Properties
tokenstringToken atual.bytesarrayLista dos bytes UTF-8 brutos do token atual. Útil ao processar emojis e caracteres chineses.logprobfloatProbabilidade logarítmica do token atual. Um valor nulo indica probabilidade extremamente baixa.created integerTimestamp indicando quando esta solicitação foi criada. Cada chunk possui o mesmo timestamp.model stringModelo utilizado nesta solicitação.object stringO valor é semprechat.completion.chunk.service_tier stringAtualmente, este parâmetro é fixo comonull.system_fingerprint stringAtualmente, este parâmetro é fixo comonull.usage objectTokens consumidos por esta solicitação. Exibido apenas no último chunk quandoinclude_usageestá definido comotrue.Properties
completion_tokensintegerQuantidade de tokens na saída do modelo.prompt_tokensintegerNúmero de tokens de entrada.total_tokensintegerTotal de tokens, correspondendo à soma deprompt_tokensecompletion_tokens.completion_tokens_detailsobject(Opcional)Informações detalhadas sobre os tokens de saída. Este campo é retornado apenas por alguns modelos.prompt_tokens_detailsProperties
audio_tokensinteger(Opcional)Número de tokens de áudio na saída. Retornado apenas para modelos com saída de áudio.reasoning_tokensinteger(Opcional)Quantidade de tokens no processo de raciocínio. Retornado apenas para modelos de raciocínio.text_tokensinteger(Opcional)Número de tokens de texto na saída.objectClassificação detalhada dos tokens de entrada.Properties
audio_tokensintegerNúmero de tokens de áudio na entrada.A quantidade de tokens de áudio em um arquivo de vídeo é retornada neste parâmetro.
text_tokensintegerQuantidade de tokens de texto na entrada.video_tokensintegerNúmero de tokens do vídeo de entrada, que pode ser uma lista de imagens ou um arquivo de vídeo.image_tokensintegerQuantidade de tokens de imagem na entrada.cached_tokensintegerNúmero de tokens que atingiram o cache. Para mais informações sobre o Context Cache, consulte Context cache.cache_creationobjectInformações de criação do explicit cache.cache_creation_input_tokensProperties
ephemeral_5m_input_tokensintegerNúmero de tokens usados para criar o cache explícito.integerQuantidade de tokens utilizados na criação do cache explícito.cache_typestringTipo de cache. O valor é fixo comoephemeral.