O modelo de mineração de dados extrai informações, modera conteúdo, classifica dados e gera resumos. Ele produz dados estruturados (como JSON) com rapidez e precisão, diferentemente dos modelos de chat de uso geral, que podem retornar formatos inconsistentes ou extrair informações incorretamente. Além disso, este modelo permite gerar apresentações PPT a partir do conteúdo de documentos, com os modos template e creative disponíveis.
Guia de implementação
O Qwen-Doc-Turbo oferece suporte à extração de informações de arquivos de três maneiras. Para obter mais detalhes sobre limites de tamanho e tipo de arquivo, consulte Limitações.
Recurso | URL do arquivo (Recomendado) | ID do arquivo | Texto simples |
|---|---|---|---|
Origem do arquivo | URL pública | Arquivo local (upload necessário) | Transmitido como string |
Limite de entrada | Até 10 arquivos. Suporta arquivos grandes (entrada máxima de 253 mil tokens) | 1 arquivo. Suporta arquivos grandes (entrada máxima de 253 mil tokens) | Até 9.000 tokens |
Compatibilidade com SDK | Apenas | Upload: |
|
Principais vantagens | Dispensa upload para o Model Studio. Suporta chamadas em lote. | Evita uploads repetidos. Ideal para reutilização. | Dispensa gerenciamento de arquivos. |
Pré-requisitos
- Você já criou uma API key e exportou a API key como variável de ambiente.
- Se planeja chamar o modelo usando um SDK, instale o OpenAI SDK ou o DashScope SDK.
Passar uma URL de arquivo
Extraia dados estruturados usando URLs de arquivos (até 10 arquivos simultaneamente). Este exemplo utiliza os arquivos Sample Product Manual A e Sample Product Manual B e solicita ao modelo que retorne as informações extraídas no formato JSON.
O método de URL de arquivo suporta apenas o protocolo DashScope. Use o DashScope Python SDK ou chamadas HTTP (como curl).
content. Observe que o conteúdo pode estar envolto em marcadores de bloco de código markdown (por exemplo, json\n[...]\n). Remova esses marcadores markdown antes de analisar a resposta com json.loads():Exemplo de resposta
Exemplo de resposta
Passar um ID de arquivo
Fazer upload de um arquivo
Antes de executar o código, baixe o arquivo Sample Product Manual A e coloque-o no diretório do seu projeto. Faça o upload do arquivo por meio da interface compatível com OpenAI para obter um file-id. Para detalhes da API de upload, consulte a Referência da API.
file-id do arquivo enviado.
Passar informações e iniciar uma conversa usando um ID de arquivo
Insira o file-id em uma mensagem de sistema (após a mensagem de definição de função). A mensagem do usuário contém sua consulta sobre o arquivo.
Exemplo completo: Fazer upload de um arquivo e chamar o modelo
Exemplo completo: Fazer upload de um arquivo e chamar o modelo
content. Observe que o conteúdo pode estar envolto em marcadores de bloco de código markdown (por exemplo, json\n[...]\n). Remova esses marcadores markdown antes de analisar a resposta com json.loads():Exemplo de resposta
Exemplo de resposta
Passar texto simples
É possível transmitir o conteúdo do arquivo diretamente como uma string em vez de usar um file-id. Para evitar confusão, coloque a mensagem de definição de função primeiro no array messages.
Se o conteúdo de texto exceder 9.000 tokens, use uma URL de arquivo ou ID de arquivo (devido aos limites de tamanho do corpo da API).
content. Observe que o conteúdo pode estar envolto em marcadores de bloco de código markdown (por exemplo, json\n[...]\n). Remova esses marcadores markdown antes de analisar a resposta com json.loads():Exemplo de resposta
Exemplo de resposta
Preços do modelo
Modelo | Janela de contexto | Entrada máx. | Saída máx. | Custo de entrada | Custo de saída | Cota gratuita |
|---|---|---|---|---|---|---|
(Tokens) | (Milhões de tokens) | |||||
qwen-doc-turbo | 262.144 | 253.952 | 32.768 | $0,087 | $0,144 | Sem cota gratuita |
Perguntas frequentes
- Onde os arquivos são armazenados após o upload pela interface de arquivo compatível com OpenAI? Os arquivos enviados por meio da interface compatível com OpenAI são armazenados gratuitamente no seu bucket do Model Studio. Para consultar e gerenciar arquivos, consulte Interface de arquivo OpenAI.
- Ao fazer upload usando o método de URL de arquivo, quais são as diferenças entre as opções do parâmetro file_parsing_strategy? "auto": analisa automaticamente com base no conteúdo. "text_only": analisa apenas texto. "text_and_images": analisa imagens e texto (aumenta o tempo de análise).
-
Como determinar se um arquivo terminou de ser analisado?
Tente iniciar uma conversa com o ID do arquivo. Se o arquivo ainda estiver sendo analisado, a API retorna
File parsing in progress, please try again later.-- tente novamente após um atraso. Se a chamada for bem-sucedida, o arquivo está pronto. - O processo de análise após o upload do arquivo gera custos extras? A análise de documentos é gratuita.
Referência da API
Para os parâmetros de entrada e saída do Qwen-Doc-Turbo, consulte a Referência da API compatível com OpenAI ou a Referência da API DashScope.
Códigos de erro
Se a chamada do modelo falhar e retornar uma mensagem de erro, consulte Códigos de erro para resolução.
Limitações
-
Dependências do SDK:
- URL de arquivo (doc_url): Suporta apenas o protocolo DashScope. Use o
DashScope Python SDKou chamadas HTTP (como curl). - Upload de arquivo (file-id): Use um SDK compatível com
OpenAIpara upload e gerenciamento.
- URL de arquivo (doc_url): Suporta apenas o protocolo DashScope. Use o
-
Upload e referência de arquivo:
- URL de arquivo (doc_url): Até 10 URLs por solicitação. As URLs devem ser acessíveis publicamente.
-
Upload de arquivo (file-id): Máximo de 150 MB por arquivo. Limites da conta: 10.000 arquivos ou 100 GB no total (os arquivos nunca expiram). Cada solicitação referencia apenas um arquivo.
As solicitações de upload falham quando os limites são atingidos. Exclua arquivos desnecessários para liberar cota. Consulte Compatível com OpenAI - Arquivo para obter detalhes.
- Formatos suportados: TXT, DOC, DOCX, PDF, XLS, XLSX, MD, PPT, PPTX, JPG, JPEG, PNG, GIF e BMP.
-
Entrada da API:
- Usando
doc_urloufile-id: máximo de 262.144 tokens. - Texto simples em mensagens
user/system: máximo de 9.000 tokens por mensagem.
- Usando
-
Saída da API:
- O comprimento máximo de saída é de 32.768 tokens.
-
Compartilhamento de arquivo:
- O
file-idfunciona apenas dentro da conta geradora -- não entre contas ou com API keys de usuários RAM.
- O
- Limite de taxa: Consulte Limitação de taxa.