A IA pode aprender o que otimizar a partir de exemplos, em vez de apenas copiá-los? O ajuste supervisionado (SFT) ensina um modelo fazendo-o imitar respostas de especialistas. Um novo artigo apresenta o PARED, um método de alinhamento que tenta extrair uma recompensa reutilizável dessas mesmas demonstrações. O PARED compara as respostas dos especialistas com as respostas próprias do modelo em características escolhidas, como utilidade, inofensividade e tópico. Ele usa essas diferenças para aprender uma recompensa explícita, que então orienta aprendizado por reforço adicional após o SFT. Usando 4.000 demonstrações geradas pelo GPT-5.1, as respostas dos modelos treinados com PARED foram preferidas às do checkpoint original de SFT em 86,2% e 88,4% das comparações não empatadas sob duas abordagens de atualização de recompensa, conforme julgado pelo Gemini 2.5 Flash. As demonstrações podem acabar sendo úteis para mais do que apenas imitação. Elas também podem ajudar a definir um objetivo do qual o modelo continua aprendendo após o SFT.
MintyCompartilhar

Fonte:Mostrar original
Aviso legal: as informações nesta página podem ter sido obtidas de terceiros e não refletem necessariamente os pontos de vista ou opiniões da KuCoin. Este conteúdo é fornecido apenas para fins informativos gerais, sem qualquer representação ou garantia de qualquer tipo, nem deve ser interpretado como aconselhamento financeiro ou de investimento. A KuCoin não é responsável por quaisquer erros ou omissões, ou por quaisquer resultados do uso destas informações.
Os investimentos em ativos digitais podem ser arriscados. Avalie cuidadosamente os riscos de um produto e a sua tolerância ao risco com base nas suas próprias circunstâncias financeiras. Para mais informações, consulte nossos termos de uso e divulgação de risco.
