source avatarMinty

Compartir

¿Puede la IA aprender qué optimizar a partir de ejemplos en lugar de simplemente copiarlos? El ajuste supervisado (SFT) enseña un modelo haciéndolo imitar respuestas de expertos. Un nuevo artículo presenta PARED, un método de alineación que intenta extraer una recompensa reutilizable de esas mismas demostraciones. PARED compara las respuestas de los expertos con las propias respuestas del modelo según características seleccionadas, como utilidad, inofensividad y tema. Utiliza esas diferencias para aprender una recompensa explícita, que luego guía un aprendizaje por refuerzo adicional tras el SFT. Utilizando 4.000 demostraciones generadas por GPT-5.1, las respuestas de los modelos entrenados con PARED fueron preferidas a las del punto de control original de SFT en el 86,2 % y el 88,4 % de las comparaciones no empatadas bajo dos enfoques de actualización de recompensa, según evaluación de Gemini 2.5 Flash. Las demostraciones podrían resultar útiles para más que solo la imitación; también podrían ayudar a definir un objetivo del que el modelo siga aprendiendo tras el SFT.

No.0 picture
Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información. Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.