Skip to main content
Suporte

FAQ

Este documento responde às perguntas mais frequentes sobre o Alibaba Cloud Model Studio.

Faturamento

  1. Quais são os preços unitários dos modelos no Alibaba Cloud Model Studio? Para descrições dos modelos, consulte o console do Model Studio. Para informações sobre preços, veja Preços de inferência de modelos.
  2. Existem serviços pré-pagos disponíveis? Sim, alguns modelos estão disponíveis com serviço pré-pago. Para mais informações, consulte Planos de economia.
  3. As faturas de pagamento conforme o uso são liquidadas mensalmente? As faturas são geradas por minuto e liquidadas mensalmente.
  4. Como visualizo minhas cobranças e detalhes de faturamento? Acesse a página de Despesas e Custos para visualizar os detalhes.
  5. Como solicito uma nota fiscal para minhas despesas? Na página de Visão Geral da Fatura Mensal, clique em Baixar Nota Fiscal na coluna Ações da conta desejada.
  6. Assinatura Wan A assinatura Wan suporta chamadas à API do Alibaba Cloud Model Studio? Não. Os benefícios da assinatura Wan não se aplicam às chamadas da API do Model Studio, pois utilizam sistemas de faturamento separados.

API/SDK

  1. Onde encontro informações sobre códigos de erro? As chamadas de API para o Alibaba Cloud Model Studio retornam um código de status que indica o resultado da operação. Para detalhes sobre cada código e sua solução, consulte Códigos de erro.
  2. Como instalo o SDK? O Alibaba Cloud Model Studio fornece SDKs para Java e Python. Para instruções, consulte Instalar o SDK.
  3. Ao usar uma chamada de função com a Assistant API, posso invocar duas funções locais em sequência? a. Atualmente, não há suporte para chamar duas funções distintas sequencialmente. b. Como alternativa, crie duas Assistant APIs separadas e trate o valor de retorno de cada uma individualmente.
  4. A Assistant API possui capacidades relacionadas à memória? No momento, não há suporte para o recurso de configuração de memória.

Perguntas sobre o produto

  1. Como ativo o serviço Alibaba Cloud Model Studio? Ative o Alibaba Cloud Model Studio por região. Faça login com sua conta Alibaba Cloud e acesse o console do Alibaba Cloud Model Studio (Singapura), console do Alibaba Cloud Model Studio (EUA (Virgínia)) ou console do Alibaba Cloud Model Studio (China (Pequim)). Alterne para a região desejada no canto superior direito do console. Após ler e concordar com o acordo de serviço, o Alibaba Cloud Model Studio será ativado automaticamente. Se o acordo não aparecer, significa que o serviço já está ativado para aquela região.
    Se uma mensagem solicitar a verificação de nome real, conclua a verificação de nome real antes de prosseguir.
  2. Como desativo o serviço Alibaba Cloud Model Studio? Atualmente, não é possível desativar o serviço Alibaba Cloud Model Studio. Se você utiliza a API para chamar modelos ou aplicações, impeça chamadas futuras excluindo sua chave de API na página API-Key (Singapura), API-Key (EUA (Virgínia)) ou API-Key (Pequim).
  3. Como experimento os serviços de grandes modelos? Acesse a página Playground (Singapura), Playground (EUA (Virgínia)) ou Playground (Pequim) para testá-los .
  4. Qual a diferença entre o Alibaba Cloud Model Studio e o Qwen? O Alibaba Cloud Model Studio é uma plataforma de serviço de modelos de linguagem de grande porte que oferece diversos modelos, incluindo a série Qwen.
  5. Como implemento isolamento de dados comerciais para garantir que informações de usuários diferentes não sejam associadas? Utilize sua conta Alibaba Cloud para conceder permissões diferentes de workspace a distintos usuários RAM. Os dados ficam isolados entre os workspaces. Para mais detalhes, consulte Gestão de permissões de workspace.
  6. O Alibaba Cloud Model Studio salva dados gerados durante as chamadas de modelo? A Alibaba Cloud protege rigorosamente a privacidade dos dados e jamais utiliza suas informações para treinamento de modelos. Todos os dados transmitidos quando você cria aplicações ou treina grandes modelos são criptografados com AES-256 (Advanced Encryption Standard). Para detalhes sobre como seus dados são tratados, consulte os termos relativos ao Alibaba Cloud Model Studio nos Termos de Serviço de Produtos do Site Internacional da Alibaba Cloud.
  7. Por quanto tempo os históricos de conversação são mantidos no Playground e existe limite para o número de conversas salvas? O console do Model Studio exibe no máximo 100 registros históricos de conversação, sem limite de tempo. Se você excluir manualmente alguns registros, o sistema mostrará automaticamente os mais antigos. Conversas de sessões de teste realizadas sem login ou aquelas que resultarem em erros de inferência não são salvas.
  8. O Alibaba Cloud Model Studio suporta a adição de identificadores implícitos ao texto gerado? Não.
  9. O Alibaba Cloud Model Studio possui um aplicativo móvel? Atualmente, o Alibaba Cloud Model Studio não oferece um aplicativo móvel oficial independente. O acesso ao serviço ocorre principalmente pelo console web.

Central de modelos

  1. Como os parâmetros de um grande modelo são armazenados? Baixe modelos open source da comunidade ModelScope. A estrutura deles geralmente é definida em arquivos JSON. Normalmente, é necessário usar bibliotecas Python open source para analisar esses arquivos, que contêm informações vetoriais úteis para compreender o processo de armazenamento.
  2. Quantos idiomas os modelos da série Qwen suportam? Eles suportam 14 idiomas: Chinês, Inglês, Árabe, Espanhol, Francês, Português, Alemão, Italiano, Russo, Japonês, Coreano, Vietnamita, Tailandês e Indonésio.
  3. Os modelos atuais conseguem se conectar a dados estruturados, como MySQL ou Hive? Ainda não há suporte para isso. No entanto, o recurso está em desenvolvimento, com prioridade para integração com o ApsaraDB RDS.
  4. A velocidade de geração de texto para modelos como Qwen-3 e Qwen-Max é fixa para todos os usuários? É possível ajustar essa velocidade? A velocidade de geração não é fixa. Ela varia conforme fatores como a carga atual do serviço e a concorrência das suas requisições.
  5. Após o acionamento do limite de taxa do modelo, quanto tempo devo esperar antes de tentar novamente? O tempo de espera depende do seu limite específico, como requisições por segundo (RPS) ou requisições por minuto (RPM). Por exemplo, se seu limite for 120 RPM (equivalente a 2 requisições por segundo) e você enviar 2 requisições consecutivas em 0,2 segundos, a terceira será limitada. Nesse caso, aguarde aproximadamente 0,8 segundos antes de enviar outra requisição com sucesso.

Alucinação do modelo

  1. O que é alucinação do modelo? Alucinação do modelo refere-se ao fenômeno em que um modelo de linguagem de grande porte (LLM) gera conteúdo sem sentido, factualmente incorreto, distorcido ou logicamente contraditório. A saída pode parecer plausível e fluente, mas é inconsistente com o prompt de entrada, fatos do mundo real ou o contexto lógico. É importante distinguir alucinação de erros factuais (como os causados por dados de treinamento desatualizados), opiniões subjetivas ou escrita criativa (como quando se pede explicitamente ao modelo para escrever uma história). A essência da alucinação é uma afirmação confiante sem base factual.
  2. Como reduzo a alucinação do modelo? Adote as seguintes estratégias para mitigar a alucinação do modelo:
    1. Escolha um modelo mais potente: Geralmente, selecionar um modelo maior e mais avançado reduz as alucinações. Na série Qwen, por exemplo, os modelos nível Max têm desempenho superior aos nível Plus, que por sua vez superam os nível Turbo.
    2. Engenharia de prompt: Modificar o prompt é uma maneira simples e eficaz de reduzir alucinações. Em cenários de Geração Aumentada por Recuperação (RAG), adicione instruções como: "Responda apenas com base nos documentos fornecidos. Se a informação não estiver disponível, diga 'Não sei'". Inclua também solicitações como "Cite dados ou relatórios específicos para embasar sua conclusão", divida tarefas complexas em etapas menores via prompt ou defina uma função estrita para o modelo.
    3. Geração Aumentada por Recuperação (RAG): Com o RAG, forneça materiais de referência para as respostas do modelo e restrinja rigorosamente as respostas ao escopo do conhecimento recuperado, reduzindo significativamente as alucinações. Ao construir um sistema RAG, garanta que o sistema de recuperação seja de alta qualidade, rotule claramente as fontes de informação e trate adequadamente os casos em que nenhuma informação relevante for encontrada.
    4. Plugins/MCP: Utilize plugins ou MCP para minimizar alucinações. Por exemplo, ao resumir dados de um banco estruturado, use plugins ou MCP para invocar um cliente de banco de dados e executar os cálculos. Retorne os resultados ao modelo para sumarização, evitando alucinações comuns quando o modelo tenta realizar cálculos numéricos diretamente.
    5. Ajuste de parâmetros do modelo: Reduzir parâmetros de aleatoriedade como temperature, top_k e top_p torna a saída mais determinística e menos propensa a gerar conteúdo bizarro, embora possa sacrificar a criatividade. Em certos cenários, diminuir max_tokens impede que o modelo invente conteúdo após fornecer as informações principais.
    6. Verificação pós-processamento: Após a conclusão da inferência, utilize uma etapa subsequente para validar a correção da resposta. Isso geralmente envolve outro processo orientado por IA para checar alucinações. Esse método aumenta os custos e o tempo total de resposta.
Plano de Tokens
Playground de Modelos
  • Music generation
Inferência do Modelo
Avaliação
Compressão de Modelos
Estatísticas e Monitoramento
Suporte