Skip to main content

Log backflow

O log backflow converte logs de inferência do SLS (Simple Log Service) em conjuntos de dados estruturados para ajuste fino ou avaliação de modelos.

Visão geral do recurso

O log backflow transfere dados de logs de inferência do SLS (Simple Log Service) para a plataforma Bailian, formata essas informações e gera conjuntos de dados estruturados (no formato JSONL). Esses conjuntos servem para ajuste fino ou avaliação de modelos. O processo produz dados estruturados, e não uma cópia direta dos logs brutos.

Escopo

O log backflow permite criar os dois tipos de conjuntos de dados a seguir:
  • Training set: Destinado ao cenário de geração de texto, com suporte aos métodos de treinamento SFT (Supervised Fine-Tuning).
  • Evaluation set: Compatível com o cenário de geração de texto.
Atualmente, o log backflow está disponível apenas nas regiões China (Beijing) e Singapore. A opção de log backflow não aparece em outras regiões. O limite máximo por operação é de 100.000 entradas. É possível executar múltiplas operações de backflow para diferentes versões do mesmo conjunto de dados e acumular um volume maior de informações. O log backflow oferece dois métodos de armazenamento: Platform Storage (padrão) . Para entender as diferenças entre os métodos e obter orientações sobre qual escolher, consulte Create a log backflow dataset. Os conjuntos de dados gerados pelo backflow são aplicáveis diretamente em tarefas subsequentes: conjuntos de treinamento servem para model tuning, enquanto conjuntos de avaliação destinam-se à avaliação de modelos.

Ativar e autorizar service relacionados

Antes de utilizar o log backflow, verifique se a região atual é China (Beijing) ou Singapore (a opção não aparece em outras regiões). Em seguida, conclua a ativação do service e a autorização de permissões na página de Model monitoring. Após a conclusão de todas as etapas, o painel lateral de configuração de autorização fecha automaticamente e o formulário de log backflow é exibido.
image

Ativar logs de auditoria e logs de inferência

Tanto os logs de auditoria quanto os logs de inferência exigem três etapas cada. O uso do log backflow só é permitido após o cumprimento de todas as seis condições. Como os logs de auditoria são pré-requisito para os logs de inferência, conclua primeiro todas as etapas referentes à auditoria. Logs de auditoria
  1. Autorize a função vinculada ao service SLS: Clique em Authorize Now para conceder permissão à função AliyunServiceRoleForSFMAccessSLS. Sem essa autorização, o sistema exibe um rótulo vermelho de Not Authorized.
  2. Ative o SLS Log Service: Caso o service esteja inativo, o status Not Activated e um link de redirecionamento aparecem na tela. Clique no link para acessar o console do SLS e concluir a ativação.
  3. Ative os logs de auditoria: Clique em Create and Enable Audit Logs. O sistema cria uma instância de LogStore e verifica periodicamente sua disponibilidade (por até 60 segundos).
Logs de inferência
  1. Autorize a função vinculada ao service SLS específica para logs de inferência.
  2. Confirme a ativação do SLS Log Service.
  3. Ative os logs de inferência: Se os logs de auditoria estiverem desativados, este botão permanece desabilitado. É obrigatório ativar os logs de auditoria antes.
A ativação deve seguir esta ordem: primeiro os logs de auditoria, depois os logs de inferência. A desativação exige a ordem inversa: desative os logs de inferência antes dos logs de auditoria. Após a desativação, não é possível recuperar os dados existentes. Certifique-se de que os dados de log não são mais necessários antes de prosseguir. Enquanto os logs de inferência estiverem ativos, o SLS gera cobranças contínuas de armazenamento e leitura/gravação. Desative-os quando deixarem de ser necessários.
A tabela a seguir resume as funções vinculadas ao service envolvidas no log backflow.

Nome da função

Finalidade

Momento da autorização

AliyunServiceRoleForSFMAccessSLS

O Bailian acessa dados de log do SLS

Autorizada uma vez para logs de auditoria e outra para logs de inferência

Criar um conjunto de dados de log backflow

Existem três pontos de entrada para o log backflow, todos direcionando para o formulário de configuração destinado à criação do conjunto de dados:
  • Model monitoring list page
  • Model monitoring detail page
  • Data management page
No topo da Monitoring list page, clique em Monitoring. Na primeira utilização, conclua a configuração de autorização previamente. Após a aprovação da autorização, o formulário de log backflow surge automaticamente.
image

Configurar parâmetros de backflow

No formulário de log backflow, configure os parâmetros seguintes de cima para baixo. Alguns parâmetros possuem pré-requisitos: a filtragem por API Key exige a seleção prévia de um intervalo de tempo, e a escolha do modelo requer tanto o intervalo de tempo quanto a API Key já definidos. Alterar o intervalo de tempo, o tipo de dados, o cenário de treinamento ou o método de treinamento redefine outros parâmetros em cascata. Por isso, recomenda-se preencher o formulário rigorosamente na ordem apresentada. A tabela abaixo detalha os valores dos parâmetros. Data management: O sistema mostra a quantidade estimada de entradas de dados do backflow com base nos filtros aplicados. Se o número ultrapassar 100.000, um aviso vermelho é exibido e o excedente não será transferido. Quando os resultados da consulta forem excessivos, o botão Log Backflow fica desabilitado, sendo necessário restringir o escopo dos filtros.
Regras de redefinição em cascata do formulário: Alterar o intervalo de tempo redefine a API Key (para Estimated backflow data) e limpa a seleção do modelo; modificar o tipo de dados, o cenário de treinamento ou o método de treinamento redefine o local de armazenamento e o método de importação.
Não é possível alterar o método de armazenamento, o tipo de dados nem o método de treinamento após a criação. Verifique atentamente antes de selecionar.

Parâmetro

Descrição

Obrigatório

Descrição dos valores

Local de backflow

Método de armazenamento do conjunto de dados

Sim

Armazenamento na plataforma (padrão). Imutável após a criação

Nome do conjunto de dados

Nome de exibição do conjunto de dados na lista

Sim

Caracteres chineses, ingleses, dígitos, sublinhados, barras e hifens, até 50 caracteres. Formato de nomenclatura recomendado: funcao_cenario_nome_modelo_data. Imutável após a criação

Descrição do conjunto de dados

Descrição complementar sobre a finalidade do conjunto de dados

Não

Até 200 caracteres

Tipo e formato

Tipo de finalidade do conjunto de dados

Sim

Conjunto de treinamento ou de avaliação. Ao selecionar conjunto de avaliação, o cenário e o método de treinamento ficam ocultos. Imutável após a criação

Cenário de treinamento

Tipo de cenário de treinamento (visível apenas para conjuntos de treinamento)

Sim

Suporte atual apenas para geração de texto

Método de treinamento

Método de ajuste fino (visível apenas para conjuntos de treinamento)

Sim

SFT; o sistema exibe as opções dinamicamente. Bloqueado após a criação

Intervalo de tempo

Período dos logs de backflow

Sim

Últimos 30 dias (incluindo hoje), com precisão de horas, minutos e segundos. Alterar este campo redefine a API Key e a seleção de modelo

Filtro de API Key

Filtra dados de log por API Key

Sim

All (sem filtro), Other (exclui as Keys listadas) ou seleção de Keys específicas (múltipla escolha)

Seleção de modelo

Modelos alvo para o backflow

Sim

Até 10. Modelos incompatíveis com o filtro de tipo de capacidade aparecem desabilitados

Visualizar resultados do backflow

Após enviar uma tarefa de log backflow, acompanhe o conjunto de dados e o progresso da importação na Data management list page.
image

Exibição na página de lista

Os conjuntos de dados criados via log backflow mostram o método de importação como OK na página de lista. O local de armazenamento aparece como All, conforme a escolha feita durante a criação. É possível verificar o status de importação da tarefa na página de lista. Em caso de falha, o sistema exibe o motivo específico do erro. No modo de armazenamento na plataforma, o sistema publica automaticamente a versão do conjunto de dados ao término da importação, sem necessidade de intervenção manual.

Informações da página de detalhes

As informações exibidas na página de detalhes do conjunto de dados variam conforme o método de armazenamento:
  • Log Ingestion: Exibe status de publicação, volume de dados, horário de criação, FileID, tipo de dados, status de importação e endereço de importação do OSS.
  • Demais casos: Apresenta status de publicação, volume de dados, horário de criação, FileID, tipo de dados e status de importação.

Acrescentar dados de log backflow

Na página de Data management, adicione um novo lote de dados de log backflow a um conjunto de dados existente das duas formas seguintes:
  • Import data page
  • Add version dialog
Acesse a página Platform Storage de um conjunto de dados existente e escolha OSS Mount como método de importação. Os parâmetros do formulário seguem o mesmo padrão do fluxo de criação. Consulte Create a log backflow dataset para mais detalhes. Este método permite ainda filtrar por workspace.Esta abordagem aplica-se a todos os tipos de armazenamento de conjuntos de dados .

Melhores práticas para backflow incremental

Recomenda-se realizar o backflow em lotes, focando em períodos distintos ou modelos específicos separadamente, para acumular gradualmente conjuntos de treinamento de alta qualidade. Cada lote pode selecionar com precisão modelos de bom desempenho e dados provenientes de horários de pico de negócio, garantindo uma qualidade superior à de um único backflow massivo.

Perguntas frequentes

Pergunta: Quais requisições estão incluídas na opção Log Backflow do filtro de API Key?A opção New Version exclui requisições das Keys listadas, abrangendo Keys removidas ou logs gerados por outros workspaces. Já a opção New Version não aplica nenhum filtro por Key. Para uma descrição completa dos três modos (All/Other/seleção individual), consulte o parâmetro de filtro de API Key em Create a log backflow dataset.
Pergunta: O limite por operação de backflow é de 100.000 entradas. Isso significa que o volume total do conjunto de dados também está restrito a 100.000 entradas?Não. O limite de 100.000 entradas aplica-se a uma única operação de backflow, não ao volume total do conjunto de dados. É possível executar múltiplos backflows para diferentes versões do mesmo conjunto, sem que o volume acumulado esteja sujeito a esse limite. Por exemplo, ao realizar backflows em lotes para períodos distintos, respeitando o teto de 100.000 entradas por vez, o conjunto final pode acumular muito mais de 100.000 entradas.
Pergunta: A ativação de logs exige procedimentos separados para auditoria e inferência. Qual a relação entre eles?Eles devem ser ativados separadamente, sendo obrigatório concluir a ativação dos logs de auditoria antes de habilitar os logs de inferência. Para as etapas operacionais, consulte Enable and authorize related services.
Pergunta: O volume estimado exibido antes do envio diverge da quantidade real de entradas após a conclusão do backflow.O volume estimado é um valor aproximado baseado nas condições de filtro. É normal haver uma leve variação entre a estimativa e a contagem real de dados após o backflow. A estimativa serve para auxiliar na decisão de ajustar os filtros (por exemplo, ao superar 100.000 entradas, o sistema sugere reduzir o escopo), não representando uma contagem exata.
Plano de Tokens
Playground de Modelos
  • Music generation
Inferência do Modelo
Avaliação
Compressão de Modelos
Estatísticas e Monitoramento
Suporte