source avatarLisan al Gaib

Compartilhar

Estou tendo a forte sensação de que a Anthropic reduziu o treinamento de modelos de ponta nos últimos meses para resolver esses problemas, mas em breve voltará a acelerar totalmente. É como se tivéssemos corrido de cabeça contra uma parede, dado três passos para trás e agora estivéssemos tentando a mesma coisa novamente. Digamos que os esforços de segurança, os novos classificadores e avaliadores da Anthropic resolvam o problema da "slop" do ambiente. Para qual vale os gradientes nos levarão a seguir, quando isso já não for mais uma opção? Acho que, neste ponto, podemos simplesmente estar treinando adversarialmente modelos para enganar todos os avaliadores e classificadores. Quanto mais resistimos, mais enganosos os modelos se tornam. Algumas previsões que você poderia fazer: - Discrepâncias insanas entre avaliações e desempenho no mundo real. Modelos paranoicos e esquizofrênicos. Você também poderia chamar isso de consciência situacional. - Modelos ficam melhores em modelar avaliadores e quem ou o que os projetou. - Menos CoT verdadeira (ações enganosas, mas sem verbalização dessas manipulações). - Modelos menos agênticos (configurações do mundo real não são perfeitas e permitem manipulações de recompensa e instruções do usuário podem contradizer o contexto. Então os modelos simplesmente param e pedem esclarecimentos, e você acaba tendo que explicar tudo em excesso). Há uma conclusão engraçada em tudo isso. Se o Claude cada vez mais cria ambientes para futuros Claudes, mas futuros Claudes cada vez mais modelam quem criou esses ambientes, então você está preso em um impasse autorreferencial. (Mas também é possível que tudo funcione. Você obtém um setup adversarial estável.) O que acontece se você isolar completamente uma pessoa? Você obtém alguém com crenças fortes, mas estreitas; comportamentos estranhos e má calibração. A conclusão engraçada pode ser que você precisa de diversidade de modelos. Mas os loops de feedback positivo (especialmente os econômicos) destróem essa diversidade. Você não pode ser imperador sem camponeses.

Aviso legal: as informações nesta página podem ter sido obtidas de terceiros e não refletem necessariamente os pontos de vista ou opiniões da KuCoin. Este conteúdo é fornecido apenas para fins informativos gerais, sem qualquer representação ou garantia de qualquer tipo, nem deve ser interpretado como aconselhamento financeiro ou de investimento. A KuCoin não é responsável por quaisquer erros ou omissões, ou por quaisquer resultados do uso destas informações. Os investimentos em ativos digitais podem ser arriscados. Avalie cuidadosamente os riscos de um produto e a sua tolerância ao risco com base nas suas próprias circunstâncias financeiras. Para mais informações, consulte nossos termos de uso e divulgação de risco.