Skip to main content
Multimodal em Tempo Real

Server events

Eventos do servidor para a API Qwen-Omni-Realtime, incluindo eventos de chamada de ferramentas (chamada de funções).

Consulte Qwen-Omni-Realtime .

error

Erro do servidor.
event_idstringIdentificador exclusivo deste evento.
{
  "event_id": "event_RoUu4T8yExPMI37GKwaOC",
  "type": "error",
  "error": {
    "type": "invalid_request_error",
    "code": "invalid_value",
    "message": "Invalid modalities: ['audio']. Supported combinations are: ['text'] and ['audio', 'text'].",
    "param": "session.modalities"
  }
}
typestringTipo do evento. Este valor é sempre error.
errorobjectDetalhes do erro.

Properties

typestringTipo do erro.codestringCódigo do erro.messagestringMensagem de erro.paramstringParâmetro associado ao erro, como session.modalities.

session.created

Retornado quando um cliente se conecta. Contém a configuração padrão da sessão.
event_idstringIdentificador exclusivo deste evento.
{
    "event_id": "event_RdvlSpbBb2ssyBjYrDHjt",
    "type": "session.created",
    "session": {
        "object": "realtime.session",
        "model": "qwen3-omni-flash-realtime",
        "modalities": [
            "text",
            "audio"
        ],
        "voice": "Cherry",
        "input_audio_format": "pcm",
        "output_audio_format": "pcm",
        "input_audio_transcription": {
            "model": "qwen3-asr-flash-realtime"
        },
        "turn_detection": {
            // The value can be server_vad or semantic_vad (only supported by qwen3.5-omni-realtime series model).
            "type": "server_vad",
            "threshold": 0,5,
            "prefix_padding_ms": 300,
            "silence_duration_ms": 800,
            "create_response": true,
            "interrupt_response": true
        },
        "enable_search": false,
        "search_options": {},
        "tools": [],
        "temperature": 0,8,
        "id": "sess_Ov7GOXoNXhNjlxXtOGKQS"
    }
}
typestringTipo do evento. Este valor é sempre session.created.
sessionobjectConfiguração da sessão.

Properties

objectstringEste valor é sempre realtime.session.modelstringModelo utilizado.modalitiesarrayModalidades de saída do modelo.voicestringVoz do áudio gerado pelo modelo.input_audio_formatstringFormato de áudio de entrada. Apenas pcm é suportado (taxa de amostragem de 16 kHz).output_audio_formatstringFormato de áudio de saída. Apenas pcm é suportado (taxa de amostragem de 24 kHz).input_audio_transcriptionobjectConfiguração de transcrição.

Properties

modelstringModelo de transcrição. Sempre qwen3-asr-flash-realtime. Não configurável.
turn_detectionobjectConfiguração de detecção de atividade de voz (VAD).

Properties

typestringTipo de VAD. Os valores válidos são server_vad (padrão) ou semantic_vad. Consulte Client events.thresholdfloatLimiar de detecção do VAD.silence_duration_msintegerDuração do silêncio (ms) que aciona a detecção de fim de fala.idle_timeout_msintegerTempo limite de ociosidade em milissegundos. Retornado apenas no modo server_vad com os modelos qwen3.5-omni-plus-realtime ou qwen3.5-omni-flash-realtime.
enable_searchbooleanIndica se a pesquisa na web deve ser ativada. Suportado apenas pela série de modelos Qwen3.5-Omni-Realtime.search_optionsobjectOpções para a pesquisa na web.temperaturefloatParâmetro de temperatura do modelo.

session.updated

Retornado após uma solicitação session.update bem-sucedida. Em caso de falha, um evento error é retornado em seu lugar.
event_idstringIdentificador exclusivo deste evento.
{
    "event_id": "event_X1HsXS4b4uptp6yo1LgKd",
    "type": "session.updated",
    "session": {
        "id": "sess_Aih6vAcY5Ddt6jwFx1tCa",
        "object": "realtime.session",
        "model": "qwen3-omni-flash-realtime",
        "modalities": [
            "text",
            "audio"
        ],
        "instructions": "You are Xiao Yun, a personal assistant. Answer user questions accurately and in a friendly manner. Always respond with a helpful attitude.",
        "voice": "Cherry",
        "input_audio_format": "pcm",
        "output_audio_format": "pcm",
        "input_audio_transcription": {
            "model": "qwen3-asr-flash-realtime"
        },
        "turn_detection": {
            // The value can be server_vad or semantic_vad (only supported by qwen3.5-omni-realtime series model).
            "type": "server_vad",
            "threshold": 0,1,
            "prefix_padding_ms": 500,
            "silence_duration_ms": 900,
            "create_response": true,
            "interrupt_response": true
        },
        "enable_search": true,
        "search_options": {
            "enable_source": true
        },
        "tools": [
            {
                "type": "function",
                "function": {
                    "name": "get_current_weather",
                    "description": "Useful for querying the weather in a specific city.",
                    "parameters": {
                        "type": "object",
                        "properties": {
                            "location": {"type": "string", "description": "The city name"}
                        },
                        "required": ["location"]
                    }
                }
            }
        ],
        "temperature": 0,8,
        "max_response_output_token": "inf",
        "max_tokens": 16384,
        "repetition_penalty": 1,05,
        "presence_penalty": 0,0,
        "top_k": 50,
        "top_p": 1,0,
        "seed":-1
    }
}
typestringTipo do evento. Este valor é sempre session.updated.
sessionobjectConfiguração da sessão.

Properties

temperaturefloatParâmetro de temperatura do modelo.modalitiesarrayModalidades de saída do modelo.voicestringVoz do áudio gerado pelo modelo.instructionsstringObjetivo e função do modelo.input_audio_formatstringFormato de áudio de entrada. Apenas pcm é suportado (taxa de amostragem de 16 kHz).output_audio_formatstringFormato de áudio de saída. Apenas pcm é suportado (taxa de amostragem de 24 kHz).input_audio_transcriptionobjectConfiguração de transcrição.

Properties

modelstringModelo de transcrição. Sempre qwen3-asr-flash-realtime. Não configurável.
turn_detectionobjectConfiguração de detecção de atividade de voz (VAD).

Properties

typestringTipo de VAD. Os valores válidos são server_vad (padrão) ou semantic_vad. Consulte Client events.thresholdfloatLimiar de detecção do VAD.silence_duration_msintegerDuração do silêncio (ms) que aciona a detecção de fim de fala.idle_timeout_msintegerTempo limite de ociosidade em milissegundos. Retornado apenas no modo server_vad com os modelos qwen3.5-omni-plus-realtime ou qwen3.5-omni-flash-realtime.
enable_searchboolean (opcional)Indica se a pesquisa na web deve ser ativada. Suportado apenas pela série de modelos Qwen3.5-Omni-Realtime.search_optionsobject (opcional)Opções de pesquisa na web.toolsarray (opcional)Definições de ferramentas. Quando configuradas, o modelo pode decidir chamar uma ferramenta com base na entrada do usuário.
typestring (obrigatório)Este valor é sempre function.function.namestring (obrigatório)Nome da função, como get_current_weather ou get_current_time.function.descriptionstring (opcional)Descrição da finalidade da função. O modelo usa essa informação para decidir se deve chamar a função.function.parametersobject (opcional)Esquema de parâmetros de entrada. O modelo usa esse esquema para extrair parâmetros. Omita se a função não aceitar parâmetros.
typestring (obrigatório)Este valor é sempre object.propertiesobject (opcional)Cada chave é um nome de parâmetro mapeado para um objeto com type e description.requiredarray (opcional)Especifica quais parâmetros de entrada são obrigatórios.
top_pfloatLimiar de probabilidade para amostragem de núcleo.top_kintegerTamanho do conjunto de candidatos para amostragem durante a geração.max_tokensintegerNúmero máximo de tokens que o modelo pode retornar para esta solicitação.repetition_penaltyfloatControla a repetição em sequências consecutivas durante a geração.presence_penaltyfloatControla a repetição no conteúdo gerado.seedintegerGrau de consistência na saída do modelo por solicitação.

input_audio_buffer.speech_started

No modo VAD, retornado quando o servidor detecta o início da fala no buffer de áudio.
Pode ser acionado sempre que áudio é adicionado ao buffer antes da detecção de fala.
event_idstringIdentificador exclusivo deste evento.
{
    "event_id": "event_Pvp8nEhsQuGCQbFJ9x58n",
    "type": "input_audio_buffer.speech_started",
    "audio_start_ms": 3647,
    "item_id": "item_YbAiGvK2H7YaS34o4R6Ba"
}
typestringTipo do evento. Este valor é sempre input_audio_buffer.speech_started.
audio_start_msintegerTempo (ms) desde o início da gravação no buffer de áudio até a primeira detecção de fala.
item_idstringID do item de mensagem do usuário criado quando o fim da fala é detectado.
Os itens de mensagem do usuário anexam a entrada do usuário ao histórico da conversa para inferência do modelo.

input_audio_buffer.speech_stopped

No modo VAD, retornado quando o servidor detecta o fim da fala no buffer de áudio. Também retorna um evento conversation.item.created com o item de mensagem do usuário correspondente.
event_idstringIdentificador exclusivo deste evento.
{
    "event_id": "event_UhQiqNVRsgUiq4KUS5Xb5",
    "type": "input_audio_buffer.speech_stopped",
    "audio_end_ms": 4453,
    "item_id": "item_YbAiGvK2H7YaS34o4R6Ba"
}
typestringTipo do evento. Este valor é sempre input_audio_buffer.speech_stopped.
audio_end_msintegerTempo (ms) desde o início da sessão até a detecção do fim da fala.
item_idstringID do item de mensagem do usuário que será criado.

input_audio_buffer.committed

Retornado quando o buffer de áudio de entrada é confirmado.
  • No modo VAD, o servidor confirma automaticamente o buffer ao detectar o fim da fala.
  • No modo Manual, retornado após o cliente enviar um evento input_audio_buffer.commit.
event_idstringIdentificador exclusivo deste evento.
{
    "event_id": "event_Iy6sUzL1nmdFgshFYxJEz",
    "type": "input_audio_buffer.committed",
    "item_id": "item_YbAiGvK2H7YaS34o4R6Ba"
}
typestringTipo do evento. Este valor é sempre input_audio_buffer.committed.
item_idstringID do item de mensagem do usuário que será criado.

input_audio_buffer.cleared

Retornado após o cliente enviar um evento input_audio_buffer.clear.
event_idstringIdentificador exclusivo deste evento.
{
  "event_id": "event_RoUu4T8yExPMI37GKwaOC",
  "type": "input_audio_buffer.cleared"
}
typestringTipo do evento. Este valor é sempre input_audio_buffer.cleared.

conversation.item.created

Retornado quando um item de conversa é criado.
event_idstringIdentificador exclusivo deste evento.
{
    "event_id": "event_JEfkrr9gO3Ny7Xcv9bGVd",
    "type": "conversation.item.created",
    "item": {
        "id": "item_YbAiGvK2H7YaS34o4R6Ba",
        "object": "realtime.item",
        "type": "message",
        "status": "in_progress",
        "role": "assistant",
        "content": [
            {
                "type": "input_audio"
            }
        ]
    }
}
// Tool calling scenario
{
    "event_id": "event_S1hkaIQgcuQD8OEdOpGHQ",
    "type": "conversation.item.created",
    "item": {
        "id": "item_FEG9qJGNkPcdf4et3p7BV",
        "object": "realtime.item",
        "type": "function_call",
        "status": "in_progress",
        "call_id": "call_bc0a7fb7235840f69ecfe4",
        "name": "get_current_weather",
        "arguments": ""
    }
}
typestringTipo do evento. Este valor é sempre conversation.item.created.
itemobjectItem de conversa a ser adicionado.

Properties

idstringID exclusivo do item de conversa.objectstringEste valor é sempre realtime.item.statusstringStatus do item de conversa.rolestringFunção da mensagem.contentarrayConteúdo da mensagem. Este parâmetro é retornado quando o tipo é message.typestringTipo do item de conversa. Os valores válidos são message ou function_call.namestringNome da função chamada quando o tipo é function_call.call_idstringQuando o type é function_call, este é o ID exclusivo da invocação da função.argumentsstringQuando o type é function_call, este parâmetro contém os argumentos para a invocação da função como uma string JSON.

conversation.item.input_audio_transcription.delta

Enviado frequentemente enquanto o usuário fala, caso a transcrição de áudio de entrada esteja ativada. Fornece resultados intermediários de transcrição em tempo real. Concatene text + stash para obter a visualização mais completa da frase a qualquer momento.
event_idstringIdentificador exclusivo deste evento.
{
    "event_id": "event_C7jzoeSFuiwOZS6tR14yx",
    "type": "conversation.item.input_audio_transcription.delta",
    "item_id": "item_ThVYhLHOdeXb4bBSvzSFF",
    "content_index": 0,
    "text": "",
    "stash": "How is the weather today?",
    "language": "en",
    "emotion": "neutral",
    "obfuscation": "ABEXGYmxdmc97u"
}
Para obter a visualização mais completa da frase a qualquer momento, concatene estes dois campos: visualização em tempo real = text + stash.
Suponha que o usuário esteja dizendo: "The weather is nice today, sunny and warm."A tabela abaixo mostra o fluxo de eventos que você pode receber e como interpretá-los:

Tempo

Progresso da fala do usuário

Resposta da API (text e stash)

Exibição na UI do cliente (text + stash)

T1

"The weather..."

text: ""

stash: "The weather"

The weather

T2

"...is nice..."

text: ""

stash: "The weather is nice"

The weather is nice

T3

"...today,"

text: "The weather"

stash: " is nice today,"

The weather is nice today,

("The weather" foi confirmado e movido para text)

T4

(breve pausa)

text: "The weather is nice today, "

stash: ""

The weather is nice today,

(primeira oração totalmente confirmada)

T5

"sunny..."

text: "The weather is nice today, "

stash: "sunny"

The weather is nice today, sunny

T6

"...and warm."

text: "The weather is nice today, "

stash: "sunny and warm."

The weather is nice today, sunny and warm.

T7

(para de falar)

-

Use a transcrição de conversation.item.input_audio_transcription.completed como resultado final.

typestringTipo do evento. Este valor é sempre conversation.item.input_audio_transcription.delta.
item_idstringID do item de conversa associado.
content_indexintegerÍndice da parte de conteúdo que contém o áudio.
textstringPrefixo de texto confirmado — a parte que o modelo finalizou e não será alterada.
stashstringSufixo de texto preliminar — um rascunho temporário após a parte confirmada, sujeito a revisão.
languagestringIdioma detectado do áudio reconhecido.
emotionstringEmoção detectada no áudio reconhecido. Valores válidos: neutral, happy, sad, angry, surprised, disgusted, fearful.

conversation.item.input_audio_transcription.completed

Indica que o áudio do usuário foi transcrito pelo modelo de reconhecimento de fala integrado (qwen3-asr-flash-realtime). Não configurável.
O texto transcrito pelo modelo de reconhecimento de fala pode diferir da interpretação gerada pelo modelo Qwen-Omni-Realtime. A transcrição serve apenas como referência.
event_idstringIdentificador exclusivo deste evento.
{
    "event_id": "event_FrrZcxiDfTB9LD9p4pVng",
    "type": "conversation.item.input_audio_transcription.completed",
    "item_id": "item_YbAiGvK2H7YaS34o4R6Ba",
    "content_index": 0,
    "transcript": "Hello."
}
typestringTipo do evento. Este valor é sempre conversation.item.input_audio_transcription.completed.
item_idstringID do item de mensagem do usuário.
content_indexintegerEste valor é sempre 0.
transcriptstringTexto transcrito.

conversation.item.input_audio_transcription.failed

Retornado quando a transcrição de áudio de entrada está ativada e a transcrição falha. Independente do evento error; ajuda os clientes a identificar falhas de transcrição especificamente.
event_idstringIdentificador exclusivo deste evento.
{
  "type": "conversation.item.input_audio_transcription.failed",
  "item_id": "<item_id>",
  "content_index": 0,
  "error": {
    "code": "<code>",
    "message": "<message>",
    "param": "<param>"
  }
}
typestringTipo do evento. Este valor é sempre conversation.item.input_audio_transcription.failed.
item_idstringID do item de mensagem do usuário.
content_indexintegerEste valor é sempre 0.
errorobjectInformações de erro.

Properties

code stringCódigo do erro.message stringMensagem de erro.param stringParâmetro relacionado ao erro.

response.created

Retornado quando o servidor começa a gerar uma nova resposta.
event_idstringIdentificador exclusivo deste evento.
{
    "event_id": "event_XuDavMzQN3KKepqGu3KRh",
    "type": "response.created",
    "response": {
        "id": "resp_HaVOPdbmX6vifiV5pAfJY",
        "object": "realtime.response",
        "conversation_id": "conv_FjJaccpnvwHNo9cPVuzGc",
        "status": "in_progress",
        "modalities": [
            "text",
            "audio"
        ],
        "voice": "Cherry",
        "output_audio_format": "pcm",
        "output": []
    }
}
typestringTipo do evento. Este valor é sempre response.created.
responseobjectObjeto de resposta.

Properties

id stringID exclusivo da resposta.conversation_id stringID exclusivo da sessão atual.object stringTipo de objeto. Para este evento, este valor é sempre realtime.response.status stringStatus da resposta. Os valores válidos são completed, failed, in_progress, ou incomplete.modalities arrayModalidades da resposta.voice stringVoz do áudio gerado pelo modelo.output arrayEste campo está vazio para este evento.

response.done

Retornado após a geração completa da resposta. O objeto response inclui todos os itens de saída, exceto dados de áudio brutos.
event_idstringIdentificador exclusivo deste evento.
{
    "event_id": "event_CSaxRRYLvbrfexDXAEuDG",
    "type": "response.done",
    "response": {
        "id": "resp_HaVOPdbmX6vifiV5pAfJY",
        "object": "realtime.response",
        "conversation_id": "conv_FjJaccpnvwHNo9cPVuzGc",
        "status": "completed",
        "modalities": [
            "text",
            "audio"
        ],
        "voice": "Cherry",
        "output_audio_format": "pcm",
        "output": [
            {
                "id": "item_Ls6MtCUWO7LM4E59QziNv",
                "object": "realtime.item",
                "type": "message",
                "status": "completed",
                "role": "assistant",
                "content": [
                    {
                        "type": "audio",
                        "transcript": "Hello! How can I help you?"
                    }
                ]
            }
        ],
        "usage": {
            "total_tokens": 377,
            "input_tokens": 336,
            "output_tokens": 41,
            "input_tokens_details": {
                "text_tokens": 228,
                "audio_tokens": 108
            },
            "output_tokens_details": {
                "text_tokens": 9,
                "audio_tokens": 32
            },
            "plugins": {
                "search": {
                    "count": 1,
                    "strategy": "agent"
                }
            }
        }
    }
}
// Tool calling scenario
{
    "event_id": "event_T1EFAJp43X2DWtDRmxTtx",
    "type": "response.done",
    "response": {
        "id": "resp_TucN5QgymL5MA8vkJvFlS",
        "object": "realtime.response",
        "conversation_id": "conv_SEDZESRlefT8WvLSmEn6E",
        "status": "completed",
        "modalities": ["text", "audio"],
        "voice": "Ethan",
        "output_audio_format": "pcm",
        "output": [
            {
                "id": "item_FEG9qJGNkPcdf4et3p7BV",
                "object": "realtime.item",
                "type": "function_call",
                "status": "completed",
                "call_id": "call_bc0a7fb7235840f69ecfe4",
                "name": "get_current_weather",
                "arguments": " {\"location\": \"Hangzhou\"}"
            }
        ],
        "usage": {
            "total_tokens": 567,
            "input_tokens": 524,
            "output_tokens": 43,
            "input_tokens_details": {
                "text_tokens": 487,
                "audio_tokens": 37
            },
            "output_tokens_details": {
                "text_tokens": 43
            }
        }
    }
}
typestringTipo do evento. Este valor é sempre response.done.
responseobjectObjeto de resposta.

Properties

id stringID exclusivo da resposta.conversation_id stringID exclusivo da sessão atual.object stringTipo de objeto. Para este evento, este valor é sempre realtime.response.status stringStatus da resposta.modalities arrayModalidades da resposta.voice stringVoz do áudio gerado pelo modelo.output objectSaída da resposta.

Properties

id stringID da saída da resposta.type stringTipo do item de saída. Os valores válidos são message ou function_call.object stringTipo de objeto do item de saída. Este valor é sempre realtime.item.status stringStatus do item de saída.role stringFunção do item de saída.content arrayConteúdo do item de saída. Este campo é retornado apenas quando o type é message.

Properties

type stringTipo de conteúdo. O valor pode ser text para saída de texto simples ou audio para saída de áudio.text stringSaída de texto.transcript stringTranscrição textual do áudio.
name stringNome da função invocada quando o tipo é function_call.call_id stringQuando o type é function_call, este é o ID exclusivo da invocação da função.arguments stringQuando o type é function_call, este campo contém os argumentos completos para a chamada de função como uma string JSON.
usage objectDetalhes de uso de tokens para esta resposta.
total_tokens integerTotal de tokens usados nesta resposta.input_tokens integerNúmero de tokens de entrada.output_tokens integerNúmero de tokens de saída.input_tokens_details objectDetalhes sobre o uso de tokens de entrada, incluindo text_tokens e audio_tokens.output_tokens_details objectDetalhes sobre o uso de tokens de saída, incluindo text_tokens e audio_tokens.plugins object (opcional)Métricas de uso de plugins. Retornado quando a pesquisa na web (enable_search) está ativada.
search objectDados de medição de pesquisa.
count integerNúmero de pesquisas.strategy stringEstratégia de pesquisa.

response.text.delta

Retornado quando a modalidade de saída é apenas texto e o modelo gera novo texto incrementalmente.
event_idstringIdentificador exclusivo deste evento.
{
    "delta": "Hello",
    "event_id": "event_TH49MauuPmRo1RGaMSlP7",
    "type": "response.text.delta",
    "response_id": "resp_PrRSvPVpnCExdUOGHHLuP",
    "item_id": "item_L8IRm9kRXFpxoOjDqDC96",
    "output_index": 0,
    "content_index": 0
}
typestringTipo do evento. Este valor é sempre response.text.delta.
deltastringTexto incremental gerado pelo modelo.
response_idstringID da resposta.
item_idstringID do item de mensagem.
output_indexintegerÍndice do item de saída na resposta. Este valor é sempre 0.
content_indexintegerÍndice da parte interna dentro do item de saída. Este valor é sempre 0.

response.text.done

Retornado quando a modalidade de saída é apenas texto e o modelo termina de gerar o texto.
Também retornado se a resposta for interrompida, incompleta ou cancelada.
event_idstringIdentificador exclusivo deste evento.
{
  "event_id": "event_B1lIeE2Nac33zn5V7h2mm",
  "type": "response.text.done",
  "response_id": "resp_B1lIdtjF4Noqpn5NOjznj",
  "item_id": "item_B1lIdJsAJlJiFs8ztWpJt",
  "output_index": 0,
  "content_index": 0,
  "text": "How can I assist you today?"
}
typestringTipo do evento. Este valor é sempre response.text.done.
response_idstringID da resposta.
item_idstringID do item de mensagem.
output_indexintegerÍndice do item de saída na resposta.
content_indexintegerÍndice do item de saída na resposta.
text stringTexto completo gerado pelo modelo.

response.audio.delta

Retornado quando a modalidade de saída inclui áudio e o modelo gera novos dados de áudio incrementalmente.
event_idstringIdentificador exclusivo deste evento.
{
  "event_id": "event_B1osWMZBtrEQbiIwW0qHQ",
  "type": "response.audio.delta",
  "response_id": "resp_P79OOMs8LnrXVpiIHUCKR",
  "item_id": "item_OFaPGtzfWCPyGzxnuEX9i",
  "output_index": 0,
  "content_index": 0,
  "delta": "{base64 audio}"
}
typestringTipo do evento. Este valor é sempre response.audio.delta.
response_idstringID da resposta.
item_idstringID do item de mensagem.
output_indexintegerÍndice do item de saída na resposta.
content_indexintegerÍndice do item de saída na resposta.
delta stringDados de áudio incrementais, codificados em Base64.

response.audio.done

Retornado quando a modalidade de saída inclui áudio e o modelo termina de gerar os dados de áudio.
Também retornado se a resposta for interrompida, incompleta ou cancelada.
event_idstringIdentificador exclusivo deste evento.
{
    "event_id": "event_Le1TDl7VfyHQxl47DtGxI",
    "type": "response.audio.done",
    "response_id": "resp_HaVOPdbmX6vifiV5pAfJY",
    "item_id": "item_Ls6MtCUWO7LM4E59QziNv",
    "output_index": 0,
    "content_index": 0
}
typestringTipo do evento. Este valor é sempre response.audio.done.
response_idstringID da resposta.
item_idstringID do item de mensagem.
output_indexintegerÍndice do item de saída na resposta.
content_indexintegerÍndice do item de saída na resposta.

response.audio_transcript.delta

Retornado quando a modalidade de saída inclui áudio e o modelo gera novo texto de transcrição response.audio_transcript.delta incrementalmente.
event_idstringIdentificador exclusivo deste evento.
{
    "event_id": "event_BksW7fOwnyavZdDxIzZYM",
    "type": "response.audio_transcript.delta",
    "response_id": "resp_HaVOPdbmX6vifiV5pAfJY",
    "item_id": "item_Ls6MtCUWO7LM4E59QziNv",
    "output_index": 0,
    "content_index": 0,
    "delta": "What"
}
typestringTipo do evento. Este valor é sempre response.audio_transcript.delta.
response_idstringID da resposta.
item_idstringID do item de mensagem.
output_indexintegerÍndice do item de saída na resposta.
content_indexintegerÍndice do item de saída na resposta.
deltastringTexto incremental.

response.audio_transcript.done

Retornado como um evento response.audio_transcript.done quando a modalidade de saída inclui áudio e o modelo conclui a transcrição do áudio.
event_idstringIdentificador exclusivo deste evento.
{
    "event_id": "event_X49tL2WerT4WjxcmH16lS",
    "type": "response.audio_transcript.done",
    "response_id": "resp_HaVOPdbmX6vifiV5pAfJY",
    "item_id": "item_Ls6MtCUWO7LM4E59QziNv",
    "output_index": 0,
    "content_index": 0,
    "transcript": "Hello! How can I help you?"
}
typestringTipo do evento. Este valor é sempre response.audio_transcript.done.
response_idstringID da resposta.
item_idstringID do item de mensagem.
output_indexintegerÍndice do item de saída na resposta.
content_indexintegerÍndice do item de saída na resposta.
transcriptstringTexto completo da transcrição.

response.function_call_arguments.delta

Retornado conforme o modelo transmite os argumentos de chamada de função em fluxo. Concatene os campos delta em ordem para construir a string de argumentos. O conteúdo completo é fornecido no evento subsequente response.function_call_arguments.done.
event_idstringIdentificador exclusivo deste evento.
{
    "event_id": "event_SlKoJyEbPEqLq14DSM1u5",
    "type": "response.function_call_arguments.delta",
    "response_id": "resp_JnTOsWXlFhKcFohZbtfz6",
    "item_id": "item_Rhcms7CauTNsQprV5S4Hr",
    "output_index": 0,
    "call_id": "call_2be200f4cafe419b9530dd",
    "delta": " {\"location\": \"Beijing\"}"
}
typestringTipo do evento. Este valor é sempre response.function_call_arguments.delta.
response_idstringID da resposta.
item_idstringID do item de mensagem.
output_indexintegerÍndice do item de saída na resposta.
call_idstringID exclusivo para esta invocação de função. É consistente com o evento done no mesmo turno.
deltastringNovo segmento da string de argumentos. Concatene os segmentos em ordem.

response.function_call_arguments.done

Indica que os argumentos de chamada de função foram totalmente gerados. O campo arguments contém a string completa de argumentos. Use os arguments deste evento — e não os resultados concatenados de delta — para analisar e chamar a função local.
event_idstringIdentificador exclusivo deste evento.
{
    "event_id": "event_X6suLyuL5agdH7r6koesM",
    "type": "response.function_call_arguments.done",
    "response_id": "resp_JnTOsWXlFhKcFohZbtfz6",
    "item_id": "item_Rhcms7CauTNsQprV5S4Hr",
    "output_index": 0,
    "name": "get_current_weather",
    "call_id": "call_2be200f4cafe419b9530dd",
    "arguments": " {\"location\": \"Beijing\"}"
}
typestringTipo do evento. Este valor é sempre response.function_call_arguments.done.
response_idstringID da resposta.
item_idstringID do item de mensagem.
output_indexintegerÍndice do item de saída na resposta.
call_idstringID exclusivo para esta invocação de função.
namestringNome da função chamada.
argumentsstringArgumentos completos da chamada de função como uma string JSON.

response.output_item.added

Retornado quando um novo item é criado durante a geração da resposta. O tipo de item pode ser message ou function_call.
event_idstringIdentificador exclusivo deste evento.
{
    "event_id": "event_DsCO341DEVtiATtCB6BUY",
    "type": "response.output_item.added",
    "response_id": "resp_HaVOPdbmX6vifiV5pAfJY",
    "output_index": 0,
    "item": {
        "id": "item_Ls6MtCUWO7LM4E59QziNv",
        "object": "realtime.item",
        "type": "message",
        "status": "in_progress",
        "role": "assistant",
        "content": []
    }
}
// Tool calling scenario
{
    "event_id": "event_HXmKt5pGoiRtXx7Hq7zpN",
    "type": "response.output_item.added",
    "response_id": "resp_TucN5QgymL5MA8vkJvFlS",
    "output_index": 0,
    "item": {
        "id": "item_FEG9qJGNkPcdf4et3p7BV",
        "object": "realtime.item",
        "type": "function_call",
        "status": "in_progress",
        "call_id": "call_bc0a7fb7235840f69ecfe4",
        "name": "get_current_weather",
        "arguments": ""
    }
}
typestringTipo do evento. Este valor é sempre response.output_item.added.
response_idstringID da resposta.
output_indexintegerÍndice do item de saída na resposta.
itemobjectInformações sobre o item de saída.

Properties

idstringID exclusivo do item de saída.objectstringEste valor é sempre realtime.item.statusstringStatus do item de saída.rolestringFunção do remetente.contentarrayConteúdo da mensagem. Este campo é retornado quando o type é message.typestringTipo do item de saída. Os valores válidos são message ou function_call.namestringNome da função a ser chamada quando o type é function_call.call_idstringID exclusivo da invocação de função atual quando o tipo é function_call.argumentsstringArgumentos da chamada de função como uma string JSON quando o type é function_call. Inicialmente uma string vazia em eventos added.

response.output_item.done

Retornado quando um item de saída é totalmente gerado.
event_idstringIdentificador exclusivo deste evento.
{
    "event_id": "event_MEu5nlLw1LsOguHiehIP8",
    "type": "response.output_item.done",
    "response_id": "resp_HaVOPdbmX6vifiV5pAfJY",
    "output_index": 0,
    "item": {
        "id": "item_Ls6MtCUWO7LM4E59QziNv",
        "object": "realtime.item",
        "type": "message",
        "status": "completed",
        "role": "assistant",
        "content": [
            {
                "type": "audio",
                "text": "Hello! How can I help you?"
            }
        ]
    }
}
// Tool calling scenario
{
    "event_id": "event_FHspdfAnCyjuME3mmAwSY",
    "type": "response.output_item.done",
    "response_id": "resp_TucN5QgymL5MA8vkJvFlS",
    "output_index": 0,
    "item": {
        "id": "item_FEG9qJGNkPcdf4et3p7BV",
        "object": "realtime.item",
        "type": "function_call",
        "status": "completed",
        "call_id": "call_bc0a7fb7235840f69ecfe4",
        "name": "get_current_weather",
        "arguments": " {\"location\": \"Hangzhou\"}"
    }
}
typestringTipo do evento. Este valor é sempre response.output_item.done.
response_idstringID da resposta.
output_indexintegerÍndice do item de saída na resposta.
itemobjectInformações do item de saída.

Properties

idstringID exclusivo do item de saída.objectstringEste valor é sempre realtime.item.statusstringStatus do item de saída.rolestringFunção do remetente.contentarrayConteúdo da mensagem. Este campo é retornado quando o type é message.typestringTipo do item de saída. Os valores válidos são message ou function_call.namestringNome da função chamada quando o tipo é function_call.call_idstringQuando o type é function_call, este é o ID exclusivo da invocação da função.argumentsstringQuando o type é function_call, contém os argumentos completos da chamada de função como uma string JSON.

response.content_part.added

Retornado quando uma nova parte de conteúdo é adicionada a um item de mensagem do assistente durante a geração da resposta.
event_idstringIdentificador exclusivo deste evento.
{
    "event_id": "event_AVBOmrgY3C8bjlRajfSUT",
    "type": "response.content_part.added",
    "response_id": "resp_HaVOPdbmX6vifiV5pAfJY",
    "item_id": "item_Ls6MtCUWO7LM4E59QziNv",
    "output_index": 0,
    "content_index": 0,
    "part": {
        "type": "audio",
        "text": ""
    }
}
typestringTipo do evento. Este valor é sempre response.content_part.added.
response_idstringID da resposta.
item_idstringID do item de mensagem.
output_indexintegerÍndice do item de saída na resposta. Este valor é sempre 0.
content_indexintegerÍndice da parte interna dentro do item de saída. Este valor é sempre 0.
partobjectInformações do item de saída.

Properties

typestringTipo da parte de conteúdo.textstringTexto da parte de conteúdo.

response.content_part.done

Retornado quando a transmissão de uma parte de conteúdo dentro de um item de mensagem do assistente termina.
event_idstringIdentificador exclusivo deste evento.
{
    "event_id": "event_Il8HD19v58Qr5IBkw7LtN",
    "type": "response.content_part.done",
    "response_id": "resp_HaVOPdbmX6vifiV5pAfJY",
    "item_id": "item_Ls6MtCUWO7LM4E59QziNv",
    "output_index": 0,
    "content_index": 0,
    "part": {
        "type": "audio",
        "text": "Hello! How can I help you?"
    }
}
typestringTipo do evento. Este valor é sempre response.content_part.done.
response_idstringID da resposta.
item_idstringID do item de mensagem.
output_indexintegerÍndice do item de saída na resposta. Este valor é sempre 0.
content_indexintegerÍndice da parte de conteúdo no array de conteúdo. Este valor é sempre 0.
partobjectInformações do item de saída.

Properties

typestringTipo da parte de conteúdo.textstringTexto da parte de conteúdo.
Referência da API de Geração de Texto
Geração de Imagens
  • FAQ
Geração de Vídeo
Áudio
API em tempo real
Incorporação de Texto
Produção de Modelos