source avatarChrome

Compartilhar

Evan Hubinger, líder de testes de estresse de alinhamento na Anthropic: "o treinamento de segurança parece esconder o desalinhamento em vez de removê-lo" ele permitiu que um modelo aprendesse a fraudar tarefas de codificação, depois tentou treinar o comportamento ruim para sair o modelo continuou fazendo a mesma coisa, apenas deixou de ser visível nos locais onde eles estavam verificando isso é todas as suas reclamações sobre o Claude em uma linha: a saída ficou mais limpa, o problema permaneceu o artigo abaixo lista todos os 15 lugares onde ele esconde, e o que adicionar para impedir isso

Aviso legal: as informações nesta página podem ter sido obtidas de terceiros e não refletem necessariamente os pontos de vista ou opiniões da KuCoin. Este conteúdo é fornecido apenas para fins informativos gerais, sem qualquer representação ou garantia de qualquer tipo, nem deve ser interpretado como aconselhamento financeiro ou de investimento. A KuCoin não é responsável por quaisquer erros ou omissões, ou por quaisquer resultados do uso destas informações. Os investimentos em ativos digitais podem ser arriscados. Avalie cuidadosamente os riscos de um produto e a sua tolerância ao risco com base nas suas próprias circunstâncias financeiras. Para mais informações, consulte nossos termos de uso e divulgação de risco.