Este documento descreve como chamar o service de inferência do modelo Kimi implantado no Alibaba Cloud Model Studio.
- OpenAI compatible
- DashScope
- US (Virginia)
- Germany (Frankfurt)
- Singapore
- Japan (Tokyo)
- China (Beijing)
- China (Hong Kong)
base_url para chamadas SDK é: https://{WorkspaceId}.us-east-1.maas.aliyuncs.com/compatible-mode/v1URL da requisição HTTP: POST https://{WorkspaceId}.us-east-1.maas.aliyuncs.com/compatible-mode/v1/chat/completions{WorkspaceId} pelo seu workspace ID real.
Pré-requisitos: Você deve get an API key e set it as an environment variable. Se usar o SDK, você deve install the SDK.
Primeiros passos
Os exemplos a seguir usam apenas entrada de texto. Para exemplos multimodais, consulte chamada multimodal.
- OpenAI compatible
- DashScope
- Anthropic compatible
- Python
- Node.js
- HTTP
Resposta
Chamadas multimodais
Os modelos kimi-k2.7-code, kimi-k2.6 e kimi-k2.5 processam simultaneamente texto, imagens ou vídeo. Use o parâmetro enable_thinking para ativar o modo de raciocínio. Os exemplos a seguir mostram como utilizar esse recurso.
Ativar ou desativar o modo de raciocínio
Os modelos kimi-k2.6 e kimi-k2.5 são híbridos de raciocínio. Eles podem responder após raciocinar ou responder diretamente. Utilize o parâmetro enable_thinking para controlar a ativação do modo de raciocínio:
true: Ativa o modo de raciocíniofalse(padrão): Desativa o modo de raciocínio
kimi-k2.7-code opera exclusivamente com raciocínio: o modo de raciocínio está sempre ativado (enable_thinking tem como padrão true e não pode ser desativado), e preserve_thinking tem como padrão true.
O kimi-k2.6 permite transmitir o processo de raciocínio em conversas de múltiplas turnos por meio do parâmetro preserve_thinking. Para mais informações, consulte Pass the thinking process.
Os exemplos abaixo demonstram como usar uma URL de imagem e ativar o modo de raciocínio. O exemplo principal ilustra a entrada de uma única imagem, enquanto o código comentado serve como exemplo para entrada de múltiplas imagens.
- OpenAI compatible
- DashScope
Compreensão de vídeo
- Video file
- Image list
-
fps: Controla a frequência de extração de quadros. O intervalo entre os quadros extraídos é de \frac 1 {fps} segundos. O valor deve estar no intervalo de [0,1, 10]. O valor padrão é 2,0.
- Para cenas com muito movimento: Defina um valor de fps mais alto para capturar mais detalhes.
- Para vídeos estáticos ou longos: Defina um valor de fps mais baixo para melhorar a eficiência do processamento.
- max_frames: Especifica o número máximo de quadros a serem extraídos de um vídeo. O valor padrão e máximo é 2000. Se o número de quadros calculado a partir do valor de fps exceder esse limite, o sistema extrairá quadros uniformemente para permanecer dentro do limite de max_frames. Este parâmetro está disponível apenas quando você usa o DashScope SDK.
- OpenAI compatible
- DashScope
Ao passar um arquivo de vídeo para o modelo usando o OpenAI SDK ou uma requisição HTTP, defina o parâmetro"type"na mensagem do usuário como"video_url".
Passar um arquivo local
Os exemplos a seguir mostram como passar um arquivo local. A API compatível com OpenAI suporta apenas codificação Base64, enquanto o DashScope suporta tanto codificação Base64 quanto caminhos de arquivo.
- OpenAI compatible
- DashScope
Limitações de arquivos
- Image limitations
- Video limitations
-
Resolução da imagem:
- Tamanho mínimo: Largura e altura devem exceder
10pixels cada. - Proporção: A razão entre o lado mais longo e o mais curto não deve exceder
200:1. - Resolução máxima: O máximo recomendado é
8K(7680x4320). Resoluções maiores podem causar timeouts na chamada da API devido ao tamanho grande dos arquivos ou transferências de rede lentas.
- Tamanho mínimo: Largura e altura devem exceder
-
Formatos de imagem suportados
-
Os seguintes formatos são suportados para resoluções abaixo de 4K
(3840x2160):Formato de imagem
Extensão de arquivo
Tipo MIME
BMP
.bmp
image/bmp
JPEG
.jpe, .jpeg, .jpg
image/jpeg
PNG
.png
image/png
TIFF
.tif, .tiff
image/tiff
WEBP
.webp
image/webp
HEIC
.heic
image/heic
-
Para resoluções entre
4K(3840x2160)e8K(7680x4320), apenas JPEG, JPG e PNG são suportados.
-
Os seguintes formatos são suportados para resoluções abaixo de 4K
-
Tamanho da imagem:
- Ao fornecer uma imagem via URL pública ou caminho local, seu tamanho não deve exceder
10 MB. - Ao usar codificação Base64, a string codificada não deve exceder
10 MB.
Para compactar um arquivo, consulte How to compress an image or video to meet the size limit .
- Ao fornecer uma imagem via URL pública ou caminho local, seu tamanho não deve exceder
- Número de imagens suportadas: Ao fornecer várias imagens, o número total de tokens para todas as imagens e texto não deve exceder o limite máximo de entrada do modelo.
Outros recursos
Modelo | |||||||
|---|---|---|---|---|---|---|---|
kimi-k2.7-code | Suportado | Suportado | Suportado | Não suportado | Não suportado | Não suportado | Suportado |
kimi-k2.6 | Suportado | Suportado | Suportado | Não suportado | Não suportado | Não suportado | Suportado |
kimi-k2.5 | Suportado | Suportado | Suportado | Não suportado | Não suportado | Não suportado | Suportado |
kimi-k2-thinking | Suportado | Suportado | Suportado | Suportado | Não suportado | Não suportado | Suportado |
Moonshot-Kimi-K2-Instruct | Suportado | Não suportado | Suportado | Não suportado | Suportado | Não suportado | Suportado |
Parâmetros padrão
Modelo | enable_thinking | temperature | top_p | presence_penalty | fps | max_frames |
|---|---|---|---|---|---|---|
kimi-k2.7-code | true (apenas modo de raciocínio) | 1.0 | 0.95 | 0.0 | 2 | 2000 |
kimi-k2.6 | false | modo de raciocínio: 1.0 modo sem raciocínio: 0.6 | Ambos os modos: 0.95 | Ambos os modos: 0.0 | 2 | 2000 |
kimi-k2.5 | false | modo de raciocínio: 1.0 modo sem raciocínio: 0.6 | Ambos os modos: 0.95 | Ambos os modos: 0.0 | 2 | 2000 |
kimi-k2-thinking | - | 1.0 | - | - | - | - |
Moonshot-Kimi-K2-Instruct | - | 0.6 | 1.0 | 0 | - | - |
Modelos e faturamento
A série Kimi consiste em grandes modelos de linguagem da Moonshot AI.
- kimi-k2.7-code: O modelo Kimi mais capaz para codificação. Segue instruções de contexto longo com mais confiabilidade e alcança taxas de sucesso mais altas em tarefas de programação. Suporta entrada de texto, imagem e vídeo, modo de raciocínio, conversação e tarefas de agente.
- kimi-k2.6: O modelo mais novo e capaz da série Kimi. Oferece desempenho aprimorado em codificação de longo horizonte, seguimento de instruções e autocorreção. Suporta entrada de texto, imagem e vídeo, modos de raciocínio e sem raciocínio, conversação e tarefas de agente.
- kimi-k2.5: Alcança desempenho de última geração (SOTA) em benchmarks de código aberto para tarefas de agente, geração de código, compreensão visual e outras tarefas de inteligência geral. Suporta entrada de imagem, vídeo e texto, modos de raciocínio e sem raciocínio, conversação e tarefas de agente.
- kimi-k2-thinking: Suporta apenas o modo de raciocínio profundo. Expõe o processo de raciocínio através do campo
reasoning_content. Destaca-se em codificação e chamada de ferramentas, sendo adequado para casos de uso que exigem análise lógica, planejamento ou compreensão profunda. - Moonshot-Kimi-K2-Instruct: Não suporta raciocínio profundo. Gera respostas com menor latência, sendo adequado para casos de uso que precisam de respostas rápidas e diretas.
Para preços do kimi-k2.7-code, consulte model invocation billing .Para detalhes sobre preços e janela de contexto, consulte o console do Model Studio. O faturamento é baseado nas contagens de tokens de entrada e saída.
No modo de raciocínio, a cadeia de pensamento conta como tokens de saída.